跳到主内容
10 signals·7 sources·2026年10月1日星期四·09-28 13:48 ~ 09-30 06:54 UTC
今日主线 · main storyline

VLA 中途变局就崩,人形量产加速

今日具身智能有三条线:LIBERO-MAX 基准对 14 种 VLA 做中途变化压力测试,事件使成功率降 11.0-25.7 个百分点;Intrinsic 开源 Core 机器人工具包;Boston Dynamics 的 Atlas 从零部件推进总装并招聘 ProtoOps。部署可靠性与制造爬坡正在取代演示。

今日研究端的主线是 部署可靠性。LIBERO-MAX 用 8000 对配对案例覆盖八类任务中途变化,发现 14 种 VLA 与混合策略在环境变化后成功率下降 11.0-25.7 个百分点,几何与观测变化是共同脆弱点;这说明从 demo 到真实部署,策略必须学会应对突发状态。与此同时,Intrinsic 发布的 开源 Core 把 FoundationPose、抓取规划与 ROS 驱动模块化,降低开发门槛。

产业端,Boston Dynamics 的 Atlas 正从零部件走向总装,并开放 ProtoOps 招聘,量产爬坡成为人形机器人竞争新焦点。机器人叙事开始从单机演示转向可制造、可维护的工程系统。

#01

LIBERO-MAX 发布 8000 对配对案例,覆盖几何、观测、外观、杂乱与路径等八类任务中途变化。对 14 种 VLA、混合及世界-动作策略测试显示,事件使成功率下降 11.0-25.7 个百分点,几何与观测变化是共同脆弱点。技术解读:通过固定任务、初始状态、种子与事件前动作序列,隔离事件相关退化,区分原有失败与环境变化失败。

via
arXiv cs.RO 论文(基准论文与评测来源)
#02

Google 支持的 Intrinsic 发布开源工具包 Core,基于 ROS、硬件无关,集成 NVIDIA FoundationPose 姿态估计、运动与抓取规划、Gazebo 仿真、相机标定及 ROS 驱动,采用 Apache 2.0。技术解读:模块化组件可复合成更复杂的机器人行为,避免每家企业重复造轮子,推动操作栈标准化。

via
Reddit r/robotics 讨论(帖子与项目信息源)
#03

Boston Dynamics 披露 Atlas 人形机器人从零部件到总装生产进展顺利,并开放 ProtoOps 等岗位招聘。技术解读:人形机器人开始从单机演示转向面向制造的工程化,装配与测试能力成为新瓶颈,团队扩张指向量产爬坡。

via
@BostonDynamics 推文(官方生产进展与招聘信息)
风向 · vibes

What practitioners are saying

DISCUSSION
“Why will Boston Dynamics win the humanoid robotics race? We've already commercialized autonomous mobile robots, creating markets with Spot and Stretch...”
— Boston Dynamics·source ↗
PAPER
“评测14种VLA、混合与世界-动作策略,事件导致成功率下降11.0-25.7%,几何与观测变化是共同脆弱点”
— LIBERO-MAX·source ↗
DISCUSSION
“AMD 与 World Labs 达成交易,凸显硅谷对机器人技术的浓厚兴趣”
— Market Talk·source ↗
研究启示 · insights

Worth re-reading

中途变化暴露脆弱性

评测14种VLA、混合与世界-动作策略,事件导致成功率下降11.0-25.7%,几何与观测变化是共同脆弱点。
— LIBERO-MAX (arXiv cs.RO)·source ↗

研究员注:此基准将部署中的动态变化进行系统隔离,提示单纯堆数据或调查询频率无法解决几何/观测鲁棒性,需要专门架构设计。

开源工具降低门槛

Core 集成 NVIDIA FoundationPose 姿态估计、运动与抓取规划、Gazebo 仿真、相机标定和 ROS 驱动,采用 Apache 2.0 许可证。
— Intrinsic / Reddit r/robotics·source ↗

研究员注:Google 系开源让底层模块标准化,但差异化竞争将上移至任务级推理与数据闭环,对中小团队是利好但需警惕同质化。

实用工具 · ship list

Tools, datasets & models shipped today

  • 开源ROS工具包,集成姿态估计、运动规划、仿真,Apache 2.0许可。↳ 适合快速构建机器人操作原型,硬件无关便于跨平台部署。
    Reddit r/robotics
  • 8000对配对案例基准,覆盖八类任务中途变化,评测策略适应能力。↳ 可用于VLA鲁棒性回归测试,诊断几何与观测脆弱点。
    arXiv cs.RO
今日全部信号 · all sources

Sources of the day

arXiv cs.RO (Robotics)/ Feed
95

LIBERO-MAX: Do Robot Policies Adapt When the World Changes?

本文提出 LIBERO-MAX 基准,包含 8000 对配对案例,覆盖几何、观测、外观、杂乱和路径等八类任务中途变化,用于评估机器人策略在目标移动、视角偏移或障碍出现后的适应能力。通过控制任务、初始状态、策略种子与事件前动作序列,对比有/无中途事件的成功率,区分事件相关退化与原有失败。对十四种 VLA、混合与世界-动作策略测试显示,事件导致成功率下降 11.0-25.7 个百分点,几何与观测变化为共同脆弱点,且改变查询频率无法消除差距。该基准为诊断中途执行变化下的策略失效提供可复现测试平台。

  • 提出 LIBERO-MAX 基准,含 8000 对配对案例,覆盖八类任务中途变化
  • 通过固定任务、初始状态、种子和事件前动作序列,分离事件相关退化
  • 评测 14 种 VLA、混合与世界-动作策略,事件导致成功率下降 11.0-25.7%
robot policyadaptationvla
9月29日
EMBODIED AI DAILY · auto-curated by GPT
Updated daily at 06:00 (your TZ)