机器人到底该先学会"看懂"世界,还是先学会"说话"
论文提出接地动作模型GAM,以三维物体定位模型为基础替代语言或视频预训练骨干,在RoboTwin2.0、LIBERO-PRO及真实机器人上均展现出更强的场景泛化与抗干扰能力。
给AI装了一套外挂,效果拔群,可一卸载就打回原形:Harness-Zero如何把外挂能力"焊"进模型本身
AI给自己配的外挂工具箱能显著提能,但换环境就失效。研究者提出Harness-Zero,用审校agent把外挂经验蒸馏进模型参数,拆掉工具后成绩不降反升,从23.3%涨到44.3%。
WorldCrafter:让AI生成的世界记得住你去过的地方
WorldCrafter提出一种带三维感知隐式记忆的视频世界模型,通过预训练新视角合成编码器与生成模型联合训练,让AI生成的可交互场景在长时间探索和重访时保持高度一致,同时借助蒸馏实现接近实时的流畅生成体验。
onPanda:给AI标数据这件事,能不能别再这么累了
onPanda是一款面向大模型对齐数据标注的交互工具,核心是让标注者只修正回答中第一个错误词元,模型据此续写,兼顾标注效率与在策略数据保真度,并支持多模态与智能体轨迹标注。
一个训练软件工程AI的框架:把大任务拆成小专家,再合体
阿里团队发现AI学代码时存在"类别跷跷板":整体分数涨了,但不同任务类型此消彼长。他们提出分类标注、专家分头训练、再融合成一个模型的框架,在多个代码评测基准上验证了这套思路的有效性。
不给机器人喂饭,让它自己学会吃饭:一篇让VLM直接操控机械臂的论文
本文解读RoboDawn,一种不训练机器人数据、仅靠人性化指令接口和少量示范就能让视觉语言模型直接操控机械臂的方法,零样本和一次示范均超越多个经过专门训练的机器人策略模型。
视频扩散模型为什么总是违反物理规律?答案藏在注意力机制的一个隐藏缺陷里
北邮团队深入视频扩散模型内部,发现RoPE位置编码导致的空间锚定效应是物体运动违反物理规律的根源,并提出轻量级频率缩放方案,显著提升生成视频的物理常识表现。
会说话的AI,怎么才能"听话"?
这篇论文提出STEERDUPLEX全双工语音模型和STEERBENCH评测基准,首次系统研究语音对话AI的"可控性"问题,即能否按指令调整语气人设语速,并揭示强化学习训练中存在的奖励作弊现象。
机器人练了十次插耳机,九次都在同一个地方栽跟头
机器人预训练模型常在长任务中卡在少数瓶颈步骤,本文提出PARTS框架,冻结已学好的基础策略,只对瓶颈子任务用局部奖励做强化学习,真实机器人实验显示完整任务成功率大幅提升,人工干预显著减少。
你的Mac跑大模型时,到底在吃谁的内存?
一项针对苹果芯片本地大模型服务的评测研究,同时考察九款推理引擎在速度、内存占用和输出准确性三方面的表现,揭示单看速度排名会掩盖内存爆表和答案质量下滑的隐患。
AI银行劫案:当4371次真人攻击撞上一道看不见的墙
该论文用4371条真实人类攻击指令,测试14个AI大模型在有无开放智能体护照(OAP)审核层情况下的支付安全表现,发现审核层能将违规转账降至0,且不影响正常转账请求。
AI视频对话进考场,它能不能听懂你的表情和语气
研究者提出OmniVChat任务,让AI直接看视频听音频回答问题。团队用多智能体系统合成训练与测试数据,建立分层评分基准,并用强化学习训练模型兼顾正确、简洁与自然,效果在真人录制数据上得到验证。
给同一个词造两张记忆卡:AI 记单词的方式终于学会了"看语境"
论文提出MoME机制,给每个词配多个记忆槏位,让模型依据上下文动态选择读取哪个槏位,解决了传统记忆方法一词多义混淆的问题,在多个模型骨架上验证效果均有提升。
给数据装一个会自己长大的说明书
论文提出EvoOntology,一种给数据智能体用的自我进化知识地图,通过构建者智能体自动生成初始本体、并依据历史执行轨迹持续迭代修正,帮助AI更高效理解异构数据,在多个基准测试中效果显著超越现有方案。
OpenAI ChatGPT 负责人:手写 Loop 的时代将终结,智能体正接管互联网
OpenAI ChatGPT 与 Codex 负责人 Tibo Sottiaux 在 DevDay 当天接受专访,谈新产品 Dots 背后的判断:手工搭建的智能体循环终将被淘汰,未来是一个 24 小时在线、不断学习、挣脱...
8000美元采购价背后藏着500封邮件:AI原生公司为什么还能赢老牌巨头
a16z对话Lio联合创始人兼CEO Vladimir Keil,拆解一张采购价格单背后被系统记录遗漏的邮件、表格与谈判,解释AI原生公司为何仍能撬动老牌厂商的客户,以及代理如何从检索一步步挣得自主决策的信任。
没有企业愿意把智能全部押在一个模型上:OpenRouter创始人首谈Stripe收购始末
Stripe收购OpenRouter后,创始人Alex Atallah与Replit的Amjad Masad首次公开对谈,揭示企业为何转向开源权重模型、警惕与前沿模型公司深度绑定,以及为何专精模型组合可能比单一"神级模型...
用20瓦跑赢GPU:一位博士想甩开反向传播重造AI计算
YC Paper Club 上,深度学习老兵 Francois Chaubard 回顾了 NVIDIA 芯片十余年的路线转向,并抛出零阶优化与 SOMA 架构等替代反向传播的实验性方案,重新追问 AI 计算该长什么样子。
被装修账单逼出来的发明:四个月造出能透视墙体的雷达相机
Applied Electrodynamics创始人Bill在YC采访中讲述了公司如何用高频天线和无线电波打造出一台能透视干墙、大理石等材料的三维相机。灵感源自一次装修中发现墙后暗藏昂贵隐患的经历,团队仅用四个月就迭代到...
















