近日,联想集团宣布基于联想问天WA7780 G3服务器,在行业内首次实现单机部署DeepSeek-R1/V3 671B大模型,以低于行业公认1TGB显存(实际768GB)承载多并发用户流畅体验,可以满足千人企业的使用需求,为行业树立了企业级大模型部署新基准。
联想问天WA7780 G3大模型训推一体服务器
突破性能限制,树立DeepSeek-R1大模型部署新基准
作为全球关注的焦点,众多企业正准备在本地化部署DeepSeek大模型。然而,在落地实施过程中用户普遍面临以下关键决策难题:单机能否部署满血版DeepSeek R1?所需最低配置是什么?如何确保高并发与吞吐量下的优质体验?如何避免采购陷阱?
联想此次突破为企业提供科学选型指南。针对行业公认1TB显存是千亿参数大模型运行基线的背景下,联想研发团队通过专家并行优化、智能访存架构升级及PCIe 5.0全互联架构创新,大幅提升了显存利用率,从而实现了性能的提升。
据了解,联想WA7780 G3服务器在2月初已实现单机768GB GPU显存条件下部署DeepSeek 671B R1和V3满血模型,并能满足中小企业的并发需求。进而通过联想万全异构智算平台的访存优化,专家并行调用策略等技术优化手段,实现了单机一个月内并发能力增长10倍, 同时还提升了每路用户的TPOT、TTFT等综合性能体验
持续优化升级,解决用户体验难题
联想的这一创新成果揭示了设备选型的新维度,也提醒企业审慎评估各种测试数据,摒弃对总吞吐量和总并发数等指标的片面追求,而应从用户体验出发,关注这些指标背后的隐藏信息,如数据精度等。实际上,如果将数据精度从FP8转为int8或int4(即量化),虽能明显改善性能表现(如更高并发量和高吞吐量),但会牺牲结果的准确性,显然这不是用户所期望的。
需要特别指出的是,高吞吐量和高并发量也并不等同于用户体验好。若服务器GPU卡配置不高,局部通信瓶颈可能引发响应延迟使体验降级,这正是联想着力解决的难点之一。
毫无疑问,联想技术突破将有效破除大模型落地瓶颈,显著加速大模型在企业的落地进程。未来,联想基础设施业务群与联想研究院ICI实验室将继续携手合作,依托联想万全异构智算平台对DeepSeek平台从AI预训练、后训练到推理的全流程进行持续优化,为客户奉献出性能更佳、性价比更高的产品和解决方案,以加速DeepSeek大模型的落地,推动新一轮生产力革命。
好文章,需要你的鼓励
美光发布新款2600客户端QLC固态硬盘,采用自适应写入技术动态优化缓存,使QLC闪存达到TLC级写入性能。该技术通过顶层SLC缓存处理新写入数据,二级TLC缓存应对SLC满载情况,空闲时将数据迁移至QLC模式。硬盘无DRAM设计,采用Phison四通道控制器和美光276层3D NAND,提供512GB至2TB容量选择,相比竞品QLC和TLC固态硬盘,顺序写入速度提升63%,随机写入速度提升49%。
清华和AIRI研究团队提出循环一致性图像编辑方法,仅需4步即可实现高质量图像编辑,速度比传统方法快10倍。该方法通过训练AI反复练习"看图-重画"过程提升图像理解能力,结合智能引导机制确保编辑质量,在多项评测中超越现有快速方法,为AI图像编辑的普及应用奠定基础。
在AMD AI推进大会上,CEO苏姿丰展示了公司在AI硬件和软件方面的显著进展。新一代MI350系列GPU性能提升4倍,高端MI355X在内存、计算吞吐量和性价比方面均优于英伟达B200。公司计划2026年推出Helios机架级平台,ROCm 7推理性能提升3.5倍。尽管在GPU训练、TCO优势等方面表现良好,但在NIMs微服务、企业级GPU市场渗透等领域仍需加强,以进一步缩小与英伟达的差距。
中科院、北大、清华联合开发的DualTHOR平台首次为双臂人形机器人提供真实家庭环境仿真训练。该平台不仅支持双手协作任务,还引入意外机制模拟现实不确定性。实验发现现有AI模型在双手协调方面表现不佳,为未来家庭服务机器人发展指明方向。