Alluxio Inc.(一家销售开源分布式文件系统和缓存商业版本的公司)今天宣布推出新功能,加快人工智能模型训练速度并增强与 Python 软件开发工具包的集成。
该公司表示,这些更新能够让组织更快地训练模型、更高效地处理大型数据集,并简化复杂的 AI 基础设施。
Alluxio 表示,这些增强功能旨在支持对重要训练数据的快速、优先访问,并与常用的 AI 框架集成。该公司已经转向解决可能需要数月时间的 AI 模型训练问题,承诺带来显著的性能提升。"我们将 DeepSeek 视为一个机会,"创始人兼首席执行官 Haoyuan Li 表示,他提到的这家中国初创公司本周因其低成本模型训练方法导致科技股下跌。"这为我们创造了更容易的销售机会。"
去年 7 月,该公司宣布其增强功能可以将昂贵的图形处理单元利用率提高到 97%。市场和产品营销副总裁 Bill Hodak 表示:"每个人都在快速行动以利用 AI,所以我们帮助他们更快创新,加速训练工作负载,更快地将模型推向市场,了解它们的使用情况,并将这些信息反馈到模型训练过程中。他们做这些事情越快,他们的模型就会越先进、越准确。"
快速缓存
Alluxio Enterprise AI 3.5 版本包含一个实验性的 CACHE_ONLY 写入模式,据称该模式显著提升了写入操作的性能。启用时,该模式将数据仅写入 Alluxio 缓存而不是底层文件系统,从而消除了存储系统相关的瓶颈。
Hodak 表示,该功能对检查点文件特别有用。检查点文件是模型在特定时间点的状态快照,可用于从保存点恢复,而不是从头重新开始。Hodak 说,这些文件可能很大,在加载过程中会导致训练过程出现长时间延迟。"如果之前需要一个小时,现在可能只需要 20 分钟。"
高级缓存清除允许管理员对缓存数据强制执行生存时间设置,该设置定义了缓存数据在自动过期和删除之前保持有效的时间。管理员现在可以为特定数据定义缓存优先级,覆盖 Alluxio 的默认"最近最少使用"算法,以保留原本会被清除的数据。
"目标是尽可能减少开销,"Hodak 说。"这提高了缓存命中率,具体取决于工作负载。"
另一个实验性功能是增强了 Alluxio 的 Python SDK 与流行 AI 框架(如 PyTorch、PyArrow 和 Ray)之间的集成。这些集成提供了统一的 Python 文件系统接口,使应用程序能够与本地和远程存储系统无缝交互。
更快的 S3 访问
此版本还对 Alluxio 访问 S3 对象存储的应用程序编程接口进行了多项增强。
HTTP 持久连接支持为多个请求维护单个 TCP 连接。这减少了为每个请求打开新连接的开销,并将 4KB S3 ReadObject 请求的延迟降低了约 40%。
Alluxio S3 API 与 Alluxio worker 之间的通信现在支持 TLS 加密和分段上传。后者将文件分成多个部分以实现更快的并行上传。
Hodak 表示,新的缓存服务提高了超大目录列表的性能,通过从缓存提供目录列表元数据,使结果的传递速度提高了五倍。
管理员现在可以设置速率限制,以控制单个 Alluxio Worker 从底层文件系统(Alluxio 用于存储缓存访问数据的底层存储系统)读取的最大带宽。
集群现在可以具有具有异构 CPU、内存、磁盘和网络配置的工作节点,从而增强了灵活性。
好文章,需要你的鼓励
从浙江安吉的桌椅,到广东佛山的沙发床垫、河南洛阳的钢制家具,再到福建福州的竹藤制品,中国各大高度专业化的家具产业带,都在不约而同地探索各自的数字化出海路径。
哥伦比亚大学研究团队开发了MathBode动态诊断工具,通过让数学题参数按正弦波变化来测试AI的动态推理能力。研究发现传统静态测试掩盖了AI的重要缺陷:几乎所有模型都表现出低通滤波特征和相位滞后现象,即在处理快速变化时会出现失真和延迟。该方法覆盖五个数学家族的测试,为AI模型选择和部署提供了新的评估维度。
研究人员正探索AI能否预测昏迷患者的医疗意愿,帮助医生做出生死决策。华盛顿大学研究员Ahmad正推进首个AI代理人试点项目,通过分析患者医疗数据预测其偏好。虽然准确率可达三分之二,但专家担心AI无法捕捉患者价值观的复杂性和动态变化。医生强调AI只能作为辅助工具,不应替代人类代理人,因为生死决策依赖具体情境且充满伦理挑战。
这项研究首次发现AI推理模型存在"雪球效应"问题——推理过程中的小错误会逐步放大,导致AI要么给出危险回答,要么过度拒绝正常请求。研究团队提出AdvChain方法,通过训练AI学习"错误-纠正"过程来获得自我纠错能力。实验显示该方法显著提升了AI的安全性和实用性,用1000个样本达到了传统方法15000个样本的效果,为AI安全训练开辟了新方向。