近日起,Google Cloud 面向全球各地推出NVIDIA T4 GPU,为包括高性能计算(HPC)、机器学习训练及推理、数据分析和图形处理等在内的各类云工作负载提供加速。今年1月,Google Cloud宣布推出了NVIDIA T4 GPU公测版,帮助客户以更快的速度和更低的成本运行推理工作负载。今年四月早些时候,在Google Next '19上,Google Cloud宣布在八个地区率先推出NVIDIA T4,使Google Cloud成为全球第一家基于NVIDIA T4提供服务的主要供应商。
每个T4 GPU都拥有16 GB的GPU内存,提供多精度(或数据类型)支持(FP32,FP16,INT8和INT4),具有可为训练提供加速的NVIDIA Tensor核心,以及可用于更快速的光线追踪的RTX硬件加速平台。用户可以使用四个T4 GPU、96个vCPU、624 GB主机内存和高达3 TB的服务器本地SSD,来搭建最能满足其需求的自定义VM配置。
自发布之时,在抢占式VM实例上,T4实例的售价仅为每GPU每小时0.29美元。按需实例的售价为每GPU每小时0.95美元起,而且持续使用还可享受高达30%的折扣。
凭借NVIDIA Turing架构,T4 GPU引入了第二代Tensor核心。Tensor 核心首次亮相于NVIDIA V100 GPU之上(Google Cloud平台(GCP)也提供基于NVIDIA V100 GPU的服务),支持混合精度,可以为在机器学习工作负载中普遍采用的矩阵乘法运算提供加速。如果您的训练工作量还未达到需要使用功能更加强大的V100的程度,那么T4将能够以更低的价格为您提供Tensor 核心的加速优势。T4非常适合应用于大规模训练工作负载中,特别是当您扩展更多资源来加快训练或训练更大的模型的时候。
Tensor核心也可以为推理提供加速,或运用机器学习模型加速生成预测,以实现低延迟或高吞吐量。当以混合精度启用Tensor核心时,与仅以FP32运行相比,借助于TensorRT, GCP上的T4 GPU可以将ResNet-50的推理速度提高10倍以上。受益于全球供货和谷歌的高速网络,GCP上的NVIDIA T4能够以高性价比,为那些需要高效运作的全球性服务供应商提供服务。例如,Snap就在使用NVIDIA T4为其全球用户群创建更有效的算法的同时,保持了低成本。
借助于Google Cloud上的深度学习VM镜像(Deep Learning VM images),可以在NVIDIA T4 GPU上快速启动和运行机器学习模型的训练和服务推理工作负载。这些应用包括了您需要的所有软件:驱动程序,CUDA-X AI库,以及主流AI框架,如TensorFlow和PyTorch。此外,Google Cloud会为您进行软件更新,使您不必再为了兼容性和性能优化的问题额外费心。您只需创建一个新的Compute Engine实例,选择您的镜像,单击Start,几分钟后,您就可以访问和启用您的由T4赋能的实例。您也可以在Google Cloud的AI平台上启动您的实例,这是一个端到端的开发环境,可帮助机器学习开发人员和数据科学家在任何地方构建、共享和运行机器学习应用程序。一旦准备就绪,只需几行代码,您就可以借助于Tensor核心的自动混合精度实现加速。
NVIDIA T4 GPU还能为HPC批量计算和渲染工作负载带来卓越的性能和效率,将大规模部署的效用价值最大化。
T4 GPU也是运行虚拟工作站的绝佳选择,能够为工程师和专业创意人员提供支持。借助于GCP Marketplace中的NVIDIA Quadro虚拟工作站,用户可以运行基于NVIDIA RTX平台的应用程序,能在任何地方体验新一代计算机图形技术,包括实时光线追踪和AI增强型图形,以及视频和图像处理。
好文章,需要你的鼓励
AI颠覆预计将在2026年持续,推动企业适应不断演进的技术并扩大规模。国际奥委会、Moderna和Sportradar的领导者在纽约路透社峰会上分享了他们的AI策略。讨论焦点包括自建AI与购买第三方资源的选择,AI在内部流程优化和外部产品开发中的应用,以及小型模型在日常应用中的潜力。专家建议,企业应将AI建设融入企业文化,以创新而非成本节约为驱动力。
字节跳动等机构联合发布GAR技术,让AI能同时理解图像的全局和局部信息,实现对多个区域间复杂关系的准确分析。该技术通过RoI对齐特征重放方法,在保持全局视野的同时提取精确细节,在多项测试中表现出色,甚至在某些指标上超越了体积更大的模型,为AI视觉理解能力带来重要突破。
Spotify在新西兰测试推出AI提示播放列表功能,用户可通过文字描述需求让AI根据指令和听歌历史生成个性化播放列表。该功能允许用户设置定期刷新,相当于创建可控制算法的每周发现播放列表。这是Spotify赋予用户更多控制权努力的一部分,此前其AI DJ功能也增加了语音提示选项,反映了各平台让用户更好控制算法推荐的趋势。
Inclusion AI团队推出首个开源万亿参数思维模型Ring-1T,通过IcePop、C3PO++和ASystem三项核心技术突破,解决了超大规模强化学习训练的稳定性和效率难题。该模型在AIME-2025获得93.4分,IMO-2025达到银牌水平,CodeForces获得2088分,展现出卓越的数学推理和编程能力,为AI推理能力发展树立了新的里程碑。