HPE今天公布了自去年收购Delivered AI之后取得的一些成果:一个用于大规模构建和训练机器学习模型的平台。

HPE表示,这个名为HPE Machine Learning Development System的系统结合了HPE Machine Learning Development Environment与计算、加速器和板载网络,可显着加速模型的开发速度。
该系统旨在解决购买和安装大规模并行处理器所涉及的、通常是很复杂的多步骤过程,包括专门的计算、存储、互连和加速器。此次面市的打包产品让企业组织可以立即就开始构建和训练机器学习模型。
HPE公司高性能计算、关键任务解决方案和实验室总经理Justin Hotard表示:“训练深度学习模型不仅复杂、耗时而且是资源密集的,很多工程师把大量时间花费在管理基础设施上,而不是专注于优化模型上,这意味着他们可以专注于业务成果、而不是技术要求。”
该系统将作为基于HPE Apollo 6500 Gen10系统的单个软件包提供给用户,起步配置是8个Nvidia A100 80 GB GPU,管理堆栈使用HPE ProLiant DL325服务器和1Gb Ethernet Aruba CX 6300交换机。
网络和存储则由Nvidia Quantum InfiniBand提供,监控和管理由HPE Performance Cluster Management提供。
Hotard说:“当今市场上普遍存在的是刚性解决方案,在规模上是非常昂贵的,同时对于客户来说这意味着更复杂、需要更长时间才能获得洞察。”而HPE的目标是为客户“在部署模型的位置和部署模型的基础设施方面提供极大的灵活性”。
HPE还通过推出HPE Swarm Learning(一种用于边缘计算或者分布式计算的隐私保护、去中心化机器学习框架)来巩固自己的AI业务。该框架为客户提供的软件容器可以与使用HPE swarm API的AI模型进行集成,让企业组织能够与其他组织共享AI模型的学习成果,而无需共享任何实际数据。
大多数AI模型训练都依赖于集中的、合并的数据集,由于需要移动大量数据,因此这既低效成本又高。在受监管的行业中,此类模型训练也可能受到限制外部数据共享、移动数据隐私以及所有权方面各项规则的约束,结果就会导致AI模型的质量较低,HPE表示。
HPE Swarm Learning让企业组织在源头位置就可以采用分布式数据,增加训练数据集大小的同时,确保遵循数据治理和数据隐私规定。区块链技术则用于保护链中成员、动态选举领导者、合并模型参数等方面。
此外,HPE还宣布在和高通合作的基础上提供更先进的推理产品,支持异构系统架构以实现大规模AI推理。HPE将提供坚固耐用的Edgeline EL8000 Converged Edge系统以及用于推理和边缘的Qualcomm Cloud AI 100加速器,该产品预计于8月全面上市。
好文章,需要你的鼓励
苏州大学研究团队提出"语境降噪训练"新方法,通过"综合梯度分数"识别长文本中的关键信息,在训练时强化重要内容、抑制干扰噪音。该技术让80亿参数的开源模型在长文本任务上达到GPT-4o水平,训练效率比传统方法高出40多倍。研究解决了AI处理长文档时容易被无关信息干扰的核心问题,为文档分析、法律研究等应用提供重要突破。
在Cloudera的“价值观”中,企业智能化的根基可以被概括为两个字:“源”与“治”——让数据有源,智能可治。
清华大学团队首次揭示了困扰AI训练领域超过两年的"幽灵故障"根本原因:Flash Attention在BF16精度下训练时会因数字舍入偏差与低秩矩阵结构的交互作用导致训练崩溃。研究团队通过深入分析发现问题源于注意力权重为1时的系统性舍入误差累积,并提出了动态最大值调整的解决方案,成功稳定了训练过程。这项研究不仅解决了实际工程问题,更为分析类似数值稳定性挑战提供了重要方法论。