跳到主内容
9 signals·5 sources·2026年9月12日星期六·09-10 05:36 ~ 09-10 20:00 UTC
今日主线 · main storyline

机器人基础模型商业化提速,单视频学习新突破

今日具身智能呈现双线进展:Skild AI 发布 S1 基础模型,可从单一视频演示学习新长时程任务,成功率66%远高于基线,并宣布达成1亿美元ARR;同时 2AM 将长程操控完成率提升至76.3%,FARM 用3.4万参数读出器从冻结世界模型解码故障,显示生成式策略控制与执行监控正快速演进。

Skild AI 发布 S1 机器人基础模型,利用 NVIDIA Isaac Lab/Cosmos 训练,能从单一视频学习新任务且无需重训,在陌生多步任务中单步成功率66%(基线9%),并与富士康合作部署双机械臂装配;同日宣布 1亿美元ARR,标志着机器人基础模型商业化进入规模化阶段。

生成式策略控制出现新范式:2AM 将任务记忆置于 Agent 侧,动作模型为无状态 VLA,在 LIBERO-Mem 上完成率从14.8%提升至76.3%;FARM 从冻结世界模型内部状态解码故障,以3.4万参数读出器达85.68 AUROC,为低成本执行监控提供了一条可行路径。

#01

S1 无需更新权重或任务后训练,采用上下文学习,可从单一视频演示学会新长时程任务。在陌生多步任务中,单步成功率66%,为基线7倍以上。模型基于 NVIDIA Isaac Lab 和 Cosmos 训练,已与富士康合作部署双机械臂执行高精度装配。这显示上下文学习正成为机器人基础模型的核心能力。

via
NVIDIA Blog (Robotics)(NVIDIA 官方博客,报道 Skild S1)
#02

2AM 将任务记忆置于 Agent 侧,动作模型为基于单 RGB、分幕无状态的 VLA,仅通过语言和 2D 抓取/放置/移动提示引导。训练使用条件丢弃、空间噪声和时间抖动,提升对不完美 Agent 输出的容忍。在 LIBERO-Mem 基准上,平均完成率从最强基线的 14.8% 提升至 76.3%,表明任务记忆可与动作模型解耦。

via
arXiv cs.RO(论文《2AM》)
#03

FARM 从冻结的机器人世界模型 VLA-JEPA 内部预测状态解码故障信息,仅训练 33,985 参数读出器即可在线输出逐步失败分数和因果轨迹风险。在多个源任务上五折评估获得 85.68 AUROC 和 88.59 AUPRC,并跨 PIPER X、SO-101、Franka 真实机器人实现迁移,无需更新预测骨干。这为低开销执行监控提供了可行路线。

via
arXiv cs.RO(论文《FARM》)
风向 · vibes

What practitioners are saying

BLOG
陌生多步任务中单步成功率66%,远高于基线9%,一段视频示范相当于约380个实操样本。
NVIDIA Blog (Robotics)·source ↗
DISCUSSION
Skild AI 宣布年度经常性收入达1亿美元,显示其机器人基础模型商业化取得重要进展。
r/robotics community·source ↗
DISCUSSION
培育具身智能产业需将人工智能之脑与物理硬件之身相结合。
马建堂(国务院发展研究中心原党组书记)·source ↗
研究启示 · insights

Worth re-reading

Agent记忆+无状态VLA

2AM将任务记忆放在Agent侧,动作模型是分幕无状态VLA,仅用单RGB和2D抓取/放置/移动提示实现长程操控。在LIBERO-Mem上平均完成率从14.8%提升至76.3%。
arXiv cs.RO (Robotics)·source ↗

研究员注:架构分离记忆与动作,降低模型负担,但依赖Agent引导精度,这可能成为长程操控的新范式。

冻结世界模型兼做故障监控

FARM从冻结的机器人世界模型VLA-JEPA内部预测状态中解码故障信息,仅训练33,985参数的读出器,在线输出逐步失败分数和因果轨迹风险。
arXiv cs.RO (Robotics)·source ↗

研究员注:低开销执行监控很有价值,冻结骨干复用特征,降低部署成本,给安全落地提供新思路。

实用工具 · ship list

Tools, datasets & models shipped today

  • 浏览器端工具,无需ROS安装即可对rosbag/MCAP运行GLIM SLAM,输出PCD/PLY/轨迹/LAZ。适合快速可视化与分享点云地图,但暂不支持.db3,功能仍在测试。
    Reddit · r/robotics
  • 机器人手运动学评分指标,评估手指协调而非单指运动,提供开源代码、在线演示与论文。可用于灵巧手设计与评估,比传统指标更真实。
    Reddit · r/robotics
今日全部信号 · all sources

Sources of the day

arXiv cs.RO (Robotics)/ Feed
96

FARM: Reading Failure Signals from the Internal Predictive States of a Frozen Robotic World Model

论文提出 FARM 方法,从冻结的机器人世界模型 VLA-JEPA 内部预测状态中解码故障信息。仅训练 33,985 参数的读出器,在线输出逐步失败分数和因果轨迹风险。在多个源任务上五折评估获得 85.68 AUROC 和 88.59 AUPRC,在 10 任务基准上 Seen 性能最佳。跨真实机器人群体和机械臂部署时,固定读出器迁移和仅读出器适应均有效,无需更新预测骨干。实验证明冻结世界模型状态可作为可复用特征,实现因果、可迁移且低开销的执行监控。

  • 从冻结机器人世界模型内部状态直接解码故障信号
  • 仅训练 3.4 万参数读出器,输出逐步失败分数与轨迹风险
  • 七源任务五折评估达到 85.68 AUROC、88.59 AUPRC
robot failure monitoringworld modelvla
9月10日
arXiv cs.RO (Robotics)/ Feed
96

Beyond Noise Steering: Dual-Latent Space Reinforcement Learning for Generative Robot Policy

本文提出双潜空间强化学习框架DLSRL,针对预训练生成式机器人策略在强化学习微调时仅控制初始噪声、忽略中间动作表示的问题。该框架同时预测初始噪声潜变量和动作表示潜变量,后者通过适配器特征和残差连接注入中间动作token的隐藏状态,实现对冻结生成器的表示级控制。实验在多种生成策略架构和机器人操作任务上表明,DLSRL能加速在线策略适应并取得竞争性能,代码已开源。

  • 提出双潜空间强化学习框架DLSRL
  • 补充初始噪声控制,增加动作表示层级控制
  • 动作表示潜变量经适配器残差注入冻结生成器
reinforcement learninggenerative robot policydual latent space
9月10日
arXiv cs.RO (Robotics)/ Feed
95

2AM: Grounding Agent-Side Memory as Guidance for Steerable Action Models in Long-Horizon Manipulation

本文提出2AM框架,将任务记忆置于Agent侧,动作模型为基于单RGB、分幕无状态的VLA,仅通过语言和2D抓取/放置/移动提示来引导。Agent将交互历史编译为子任务语言和可选的物理意图提示,在不同时间尺度绑定动作。为训练可引导性,作者在演示中加入结构化提示标签,并使用条件丢弃、空间噪声和时间抖动增强鲁棒性。在LIBERO-Mem基准上,无深度、在线几何或规划器物体运动,2AM达到76.3%平均完成率,较最强基线14.8%提升61.5个百分点,表明任务记忆可保留在Agent侧,且动作模型能力取决于Agent引导精度。

  • 2AM将任务记忆放在Agent侧,动作模型是分幕无状态VLA
  • 仅用单RGB和2D抓取/放置/移动提示实现长程操控
  • 条件丢弃、空间噪声、时间抖动训练提升对不完美Agent输出的容忍
embodied-airobot-manipulationvla
9月10日
EMBODIED AI DAILY · auto-curated by GPT
Updated daily at 06:00 (your TZ)