今年5月NVIDIA推出Ampere GPU架构的时候,公布了一套名为Selene的新型超级计算机,总性能在全球排名第7。Selene现在成为美国最快的工业系统,也是有史以来第二高能效的系统。Selene采用风冷方式,在标准数据中心内构建完成仅仅用了三周时间,而通常安装一套超级计算机需要9-12个月。如此之快,很可能是因为采用了NVIDIA即插即用的DGX系统,该系统配置了AMD CPU、A100 GPU和Mellanox HDDR网络。不久之后,佛罗里达大学宣布他们也构建了同样是基于DGX A100平台的超级计算机。因此,NVIDIA履行了首席执行官黄仁勋(Jensen Huang)的承诺,即NVIDIA不仅有GPU业务,还将在端到端数据中心的竞争中脱颖而出。
Selene不是NVIDIA首次涉足基于DGX的超级计算机,NVIDIA最早是在2017年推出Volta GPU的时候公布了SaturnV超级计算机。NVIDIA在构建自有超级计算机的过程中积累了很多经验,从而帮助NVIDIA将这些经验运用于学术界和大型云基础设施,同时为NVIDIA工程师们提供世界一流的产品设计和软件优化计算平台。SaturnV和Selene还可作为参考架构,供潜在客户进行测试,以确定是否可以满足他们的需求,让外界对于NVIDIA作为高性能基础设施的一级厂商充满信心。不仅佛罗里达大学对于NVIDIA系统的表现印象深刻,美国阿贡国家实验室、微软和洛克希德·马丁公司也都拥有了自己的DGX SuperPOD,而且该设计在HGX版本中已经开源,任何数据中心都可以根据需要自行构建。
许多媒体文章中都详细介绍过,这套系统是在疫情期间配置和安装的,为了遵守社交隔离政策,只有两个安装团队。我们在这里想重点谈一谈该系统对NVIDIA业务及其合作伙伴业务的意义和影响。
NVIDIA在DGX和HGX参考体系结构方面拥有丰富的经验,NVIDIA和合作伙伴网络也进行了整体的升级,提供从芯片和模块到包括软件、计算基础设施、网络和存储在内的全套数据中心。现在,客户可以直接找NVIDIA合作伙伴经销商或者DGX就绪数据中心合作伙伴安装DGX、DGX POD和DGX SuperPOD,或者以云的方式获得这些资源。可以肯定的是,DGX A100并不便宜,起价为19.9万美元,但是客户能够在几周之内(而不是几个月)就让系统平稳且低风险地运转起来。
NVIDIA尚未将该系统的收入数据从其他业务中划分出来,但是我预计这个产品系列将会迅速增长,成为NVIDIA的一个重要收入和利润来源。毕竟,NVIDIA到目前为止至少有十几个DGX客户,而Selene本身配置有280个DGX A100,如果有人要购买的话,标价为5600万美元。
最重要的是,NVIDIA一直在价值链上端发展,致力于将以往归于OEM合作伙伴的收入和利润收入自己的囊中。
好文章,需要你的鼓励
随着人工智能和高性能计算持续推动需求增长,数据中心设计正以同样惊人的速度演进。曾经的高密度机架已成为标准配置,冷却系统在数月而非数年内完成重新设计,项目在各地区的规模和复杂性不断提升。全球工程设计咨询公司Black & White Engineering指出,液冷成为标准配置、极端机架密度管理、工业化规模交付、电网约束下的电力创新、AI驱动运营设计以及可持续性成为核心设计原则,将成为2026年塑造数据中心设计、建设和运营的六大关键趋势。
Allen AI研究所联合多家顶尖机构推出SAGE智能视频分析系统,首次实现类人化的"任意时长推理"能力。该系统能根据问题复杂程度灵活调整分析策略,配备六种智能工具进行协同分析,在处理10分钟以上视频时准确率提升8.2%。研究团队创建了包含1744个真实娱乐视频问题的SAGE-Bench评估平台,并采用创新的AI生成训练数据方法,为视频AI技术的实际应用开辟了新路径。
Snowflake本周推送的一次更新导致全球范围内的"重大故障",用户长达13小时无法查询数据、文件导入失败并收到错误信息。初步调查显示,最新版本引入了不向后兼容的数据库架构更新,导致版本不匹配错误。此次故障影响了全球23个区域中的10个,包括美国、欧洲和亚洲多个数据中心。这是Snowflake一周内第二次发生事故。
中科院团队首次系统评估了AI视觉模型在文本压缩环境下的理解能力,发现虽然AI能准确识别压缩图像中的文字,但在理解深层含义、建立关联推理方面表现不佳。研究通过VTCBench测试系统揭示了AI存在"位置偏差"等问题,为视觉文本压缩技术的改进指明方向。