今日研究界开始用安慰剂对照检验VLA运行时纠正,发现许多「拯救」源于策略自身变异性,OCBench 也重现行为克隆中过拟合提升性能等现象。
产业端,黑莓 QNX 与英伟达合作,已为波士顿动力人形机器人、Agility Robotics Digit 等提供底层系统支撑,实时内核正成为规模化前提。
今日多篇论文对机器人学习中的「神器」进行严格实证:冻结VLA上运行时纠正大多无显著增益,行为克隆存在多重反常。与此同时,黑莓QNX凭借实时安全内核切入人形与四足机器人底层,为标杆产品提供系统支撑。行业正从炫技转向可验证的工程能力。
今日研究界开始用安慰剂对照检验VLA运行时纠正,发现许多「拯救」源于策略自身变异性,OCBench 也重现行为克隆中过拟合提升性能等现象。
产业端,黑莓 QNX 与英伟达合作,已为波士顿动力人形机器人、Agility Robotics Digit 等提供底层系统支撑,实时内核正成为规模化前提。
在四个RoboTwin任务上配对测试3888个回合,完整纠正流程仅在 hammer 任务提升成功率 +13.5pp,其他无显著增益。失败回合中43.2%普通重跑成功,纠正后63.5%,显示许多「拯救」来自策略自身变异性。固定时间触发与脚本回退与学习流程无显著差异。
OCBench 通过脚本策略模拟人类演示,重现行为克隆中的过拟合反而提升性能、动作分块必要性等反常现象。GPU 加速环境支持大规模假设检验,反驳多个流行解释。表明闭环策略中的分块并非万能,需科学分析归因。
黑莓凭借 QNX 实时安全内核已进入超2.75亿辆汽车,并与英伟达合作,为波士顿动力人形机器人、Agility Robotics Digit、达芬奇手术机器人提供底层系统。2027财年一季度业绩大幅增长,凸显机器人软件栈的商业价值。
在响应性任务失败的基础回合中,43.2% 在普通重跑中成功,纠正后升至 63.5%,表明许多名义拯救源自策略自身变异性。
研究员注:评估修复策略时,必须与同种子重跑基线对比,否则会高估有效性;这提醒研究者重视策略内部随机性。
本文提出 OCBench,一个机器人操作基准,使用可控脚本策略模拟人类演示的关键特性,重现行为克隆中的多种反常现象,如过拟合提升性能、动作分块的必要性等。
研究员注:可控脚本策略让 BC 现象可被科学分析,提示过拟合不一定有害;基准设计比新算法更紧迫。