谷歌今天宣布对其云平台进行扩展,发布了一个新的基础设施选项Cloud TPU Pod,旨在满足那些需要大量计算能力的大型人工智能项目。
Cloud TPU Pod本质上是一组运行在谷歌数据中心中的服务器机架,每个机架都配备了谷歌的Tensor处理器单元(TPU)——完全为AI应用开发的定制芯片。谷歌已经在内部一系列服务中采用了这种芯片,包括谷歌的搜索引擎和谷歌翻译等。
此前TPU在Google Cloud上仅供单独租赁使用。与企业通常在AI项目中使用的GPU相比,TPU具有速度更快等诸多优势。去年12月公布的一项基准测试结果显示,在执行某些类型的任务时,TPU的性能比Nvidia同类硬件高出19%。
单个Cloud TPU Pod中包含256个或者1024个芯片,具体取决于配置。256个芯片的版本采用了谷歌在2017年推出的第二代TPU,峰值速度为11.5 petaflops。1024个芯片的版本采用了谷歌新推出的第三代TPU,峰值速度可达到107.5 petaflops。
这些性能数据表明该产品主要针对高性能计算机领域。目前全球最强大的超级计算机Summit峰值速度为200 petaflops。
事实上,Cloud TPU Pod在处理复杂性低于Summit等系统的数据时才能达到峰值性能,但总的来说它仍然是很强大的。谷歌通过API向用户提供Cloud TPU Pod,这样AI团队就可以像使用一个逻辑单元那样使用Cloud TPU Pod了,或者开发人员可以把一个Cloud TPU Pod的计算能力分散到多个应用中。
谷歌Cloud TPU高级产品经理Zak Stone在一篇博客文章中这样写道:“用户还可以使用更小‘切片’的Cloud TPU Pod。我们经常会看到ML团队在单独的Cloud TPU上开发他们最初的初始模型,然后通过数据并行和模型并行扩展到越来越大的Cloud TPU Pod切片。”
Cloud TPU Pod目前还处于测试阶段,早期客户包括eBay和总部位于犹他州的生物科技公司Recursion Pharmaceutical——该公司使用Cloud TPU Pod在对具有潜在医疗价值的分子进行测试。
好文章,需要你的鼓励
IBM Spyre加速器将于本月晚些时候正式推出,为z17大型机、LinuxONE 5和Power11系统等企业级硬件的AI能力提供显著提升。该加速器基于定制芯片的PCIe卡,配备32个独立加速器核心,专为处理AI工作负载需求而设计。系统最多可配置48张Spyre卡,支持多模型AI处理,包括生成式AI和大语言模型,主要应用于金融交易欺诈检测等关键业务场景。
微软研究院提出潜在分区网络(LZN),首次实现生成建模、表示学习和分类任务的真正统一。该框架通过共享高斯潜在空间和创新的潜在对齐机制,让原本独立的AI任务协同工作。实验显示LZN不仅能增强现有模型性能,还能独立完成各类任务,多任务联合训练效果更是超越单独训练。这项研究为构建下一代通用AI系统提供了新的架构思路。
意大利初创公司Ganiga开发了AI驱动的智能垃圾分拣机器人Hoooly,能自动识别并分类垃圾和可回收物。该公司产品包括机器人垃圾桶、智能盖子和废物追踪软件,旨在解决全球塑料回收率不足10%的问题。2024年公司收入50万美元,已向谷歌和多个机场销售超120台设备,计划融资300万美元并拓展美国市场。
上海AI实验室开发的VLAC模型让机器人首次具备真实世界自主学习能力。该系统如同给机器人配备智能导师,能实时评估动作效果并从中学习。在四个操作任务测试中,机器人成功率从30%提升至90%,仅需200次练习。技术结合视觉、语言理解和动作生成,支持跨场景适应和人机协作,为家庭服务、医疗护理等领域应用奠定基础。