
7 月 24 日,国内权威第三方评测机构 SuperCLUE 发布中文原生工业大模型测评基准 SC-Industry(SuperCLUE-Industry)最新榜单。北电数智骄阳·工业大模型以83.44 的总分综合排名第一。
图注:SuperCLUE 发布工业大模型能力象限
SuperCLUE 是行业权威的通用大模型综合性测评基准,专注于中文大模型测评;SC-Industry立足中文语义环境与工业场景,充分贴合国内制造业的术语体系与应用需求,全面地衡量工业大模型除知识库之外解决行业具体问题的应用能力,兼具工业领域模型的通用性与可拓展性。
SC-Industry评测从基础能力和应用能力两大维度出发,聚焦工业常规问答、工业数据分析、工业文档问答、工业智能体Agent、工业理解计算、工业代码生成六大能力,对大模型进行效果评估。通过构建专用测评集,SC-Industry结合评估流程、评估标准、评分规则,将文本输入送入超级模型,并对每一维度的评估结果与人类一致性进行分析。

根据榜单测评结果,骄阳·工业大模型在整体总分第一之外,“应用能力”综合测评结果获90.07分,同样位居榜首。
SuperCLUE在报告中指出,产业级应用能力成为新分水岭。骄阳·工业大模型凭借在工业数据分析上的强势表现,得到了业界领先的 90.07 分,首次登顶。这一方面说明在工业任务能力方面,国产模型正在突围;另一方面表明在基础能力趋同的情况下,工业数据分析与智能体表现将成为拉开差距的关键。
北电数智以产业协同、技术突破双轮驱动破局,一方面推动建立工业数据标准和开放协议体系,运用可信数据空间技术实现数据的安全共享;另一方面重点研发场景化微调数据生成和复杂任务强化学习等核心技术,有效提升模型的行业认知能力。目前,骄阳·工业大模型已成功构建“精准的垂类认知、高质量数据治理体系、严格的安全合规管控机制”三大优势,展现了北电数智在垂类大模型领域的阶段性研发成果,也体现了依托北京电控深厚工业基因的差异化竞争能力。
在即将到来的2025 WAIC世界人工智能大会上,北电数智将正式发布骄阳·工业大模型,并聚焦工业企业最关注的“AI+生产、AI+产品、AI+运营、AI+基础设施”等核心业务场景,分享北电数智的创新能力和标杆实践,敬请关注。
好文章,需要你的鼓励
杜克大学研究团队建立了首个专门针对Web智能体攻击检测的综合评估标准WAInjectBench。研究发现,现有攻击手段极其多样化,从图片像素篡改到隐藏弹窗无所不包。虽然检测方法对明显恶意指令有中等效果,但对隐蔽攻击几乎无能为力。研究构建了包含近千个恶意样本的测试数据库,评估了十二种检测方法,揭示了文本和图像检测的互补性。这项研究为Web智能体安全防护指明了方向,提醒我们在享受AI便利时必须保持安全意识。
生成式AI的兴起让谷歌和Meta两大科技巨头受益匪浅。谷歌母公司Alphabet第三季度广告收入同比增长12%达742亿美元,云服务收入增长33%至151.5亿美元,季度总收入首次突破千亿美元大关。Meta第三季度收入512.5亿美元,同比增长26%。两家公司都将大幅增加AI基础设施投资,Meta预计2025年资本支出提升至700亿美元,Alphabet预计达910-930亿美元。
加州大学圣地亚哥分校研究团队系统研究了AI智能体多回合强化学习训练方法,通过环境、策略、奖励三大支柱的协同设计,提出了完整的训练方案。研究在文本游戏、虚拟家庭和软件工程等多个场景验证了方法有效性,发现简单环境训练能迁移到复杂任务,监督学习初始化能显著减少样本需求,密集奖励能改善学习效果。这为训练能处理复杂多步骤任务的AI智能体提供了实用指南。