Alluxio Inc.(一家销售开源分布式文件系统和缓存商业版本的公司)今天宣布推出新功能,加快人工智能模型训练速度并增强与 Python 软件开发工具包的集成。
该公司表示,这些更新能够让组织更快地训练模型、更高效地处理大型数据集,并简化复杂的 AI 基础设施。
Alluxio 表示,这些增强功能旨在支持对重要训练数据的快速、优先访问,并与常用的 AI 框架集成。该公司已经转向解决可能需要数月时间的 AI 模型训练问题,承诺带来显著的性能提升。"我们将 DeepSeek 视为一个机会,"创始人兼首席执行官 Haoyuan Li 表示,他提到的这家中国初创公司本周因其低成本模型训练方法导致科技股下跌。"这为我们创造了更容易的销售机会。"
去年 7 月,该公司宣布其增强功能可以将昂贵的图形处理单元利用率提高到 97%。市场和产品营销副总裁 Bill Hodak 表示:"每个人都在快速行动以利用 AI,所以我们帮助他们更快创新,加速训练工作负载,更快地将模型推向市场,了解它们的使用情况,并将这些信息反馈到模型训练过程中。他们做这些事情越快,他们的模型就会越先进、越准确。"
快速缓存
Alluxio Enterprise AI 3.5 版本包含一个实验性的 CACHE_ONLY 写入模式,据称该模式显著提升了写入操作的性能。启用时,该模式将数据仅写入 Alluxio 缓存而不是底层文件系统,从而消除了存储系统相关的瓶颈。
Hodak 表示,该功能对检查点文件特别有用。检查点文件是模型在特定时间点的状态快照,可用于从保存点恢复,而不是从头重新开始。Hodak 说,这些文件可能很大,在加载过程中会导致训练过程出现长时间延迟。"如果之前需要一个小时,现在可能只需要 20 分钟。"
高级缓存清除允许管理员对缓存数据强制执行生存时间设置,该设置定义了缓存数据在自动过期和删除之前保持有效的时间。管理员现在可以为特定数据定义缓存优先级,覆盖 Alluxio 的默认"最近最少使用"算法,以保留原本会被清除的数据。
"目标是尽可能减少开销,"Hodak 说。"这提高了缓存命中率,具体取决于工作负载。"
另一个实验性功能是增强了 Alluxio 的 Python SDK 与流行 AI 框架(如 PyTorch、PyArrow 和 Ray)之间的集成。这些集成提供了统一的 Python 文件系统接口,使应用程序能够与本地和远程存储系统无缝交互。
更快的 S3 访问
此版本还对 Alluxio 访问 S3 对象存储的应用程序编程接口进行了多项增强。
HTTP 持久连接支持为多个请求维护单个 TCP 连接。这减少了为每个请求打开新连接的开销,并将 4KB S3 ReadObject 请求的延迟降低了约 40%。
Alluxio S3 API 与 Alluxio worker 之间的通信现在支持 TLS 加密和分段上传。后者将文件分成多个部分以实现更快的并行上传。
Hodak 表示,新的缓存服务提高了超大目录列表的性能,通过从缓存提供目录列表元数据,使结果的传递速度提高了五倍。
管理员现在可以设置速率限制,以控制单个 Alluxio Worker 从底层文件系统(Alluxio 用于存储缓存访问数据的底层存储系统)读取的最大带宽。
集群现在可以具有具有异构 CPU、内存、磁盘和网络配置的工作节点,从而增强了灵活性。
好文章,需要你的鼓励
2025年12月18日,OpenAI CEO山姆·奥特曼(Sam Altman)做客Big Technology Podcast,与主持人Alex Kantrowitz进行了一场长达近一小时的深度对话。
这项由蚂蚁集团、香港科技大学等机构研究者完成的工作提出了Ditto框架,通过创新的数据生成管道解决了视频编辑领域的数据稀缺问题。研究团队生成了包含一百万个高质量视频编辑样本的Ditto-1M数据集,并基于此训练了Editto模型。该模型在多项评估中显著超越现有方法,实现了更精准的指令遵循和更好的时间一致性,为指令驱动的视频编辑树立了新的技术标杆。
2025年12月17日,Google DeepMind播客发布了本季收官之作。数学家Hannah Fry与公司联合创始人兼CEO Demis Hassabis进行了年度深度对话。
这项由阿里巴巴和中科院联合完成的研究提出了ImagerySearch,一种创新的视频生成方法,能够帮助AI生成更好的创意和想象力十足的视频。研究团队还创建了LDT-Bench,首个专门评估AI在处理奇异场景能力的基准。实验表明,ImagerySearch在处理创意场景时相比现有方法有显著提升,为AI创意内容生成开辟了新的方向。