跳到主内容
12 signals·6 sources·2026年9月11日星期五·09-08 09:50 ~ 09-10 10:51 UTC
今日主线 · main storyline

单视频学新任务:机器人基础模型开启行动预测时代

Skild AI 发布 S1 机器人基础模型,可从单一视频演示学习长时程新任务,无需重训并实现商业化里程碑;ECCV 2026 上世界模型从理解转向预测可行动的未来。同时,免扩散模仿学习等新范式提升策略效率,具身智能竞争从生成逼真视频转向行动闭环与物理一致。

今日主线:具身智能从「看视频」进入「学动作」。Skild AI S1 模型通过上下文学习,用一段视频演示即可学会多步任务,并在富士康产线部署。与此同时,其年度经常性收入达 1 亿美元,验证机器人基础模型商业化。

ECCV 2026 上,世界模型讨论空前密集,中国学者提出 WAM、4DWorldBench 与 AtomicVLA,强调预测未来必须进入行动路径。趋势合流:世界模型、3D 高斯、具身智能首次正式会师。

#01

S1 机器人基础模型在 NVIDIA Isaac Lab 与 Cosmos 上构建,可从单视频演示学习新长时程任务,无需更新权重。新多步任务单步成功率 66%,为基线 9% 的 7 倍以上;一段视频示范约等于 380 个实操样本。已与富士康合作部署双机械臂高精度装配。

via
NVIDIA Blog(官方技术博客)
#02

ECCV 2026 设 13 个世界模型/具身智能 workshop。中国学者提出 WAM 概念,强调预测未来必须进入行动路径;4DWorldBench 从空间、时间、物理、任务四维评测;eWAM、AtomicVLA 等实现真机落地。三股趋势合流:世界模型范式、3D 高斯、具身智能产业化。

via
雷锋网(科技媒体报道)
#03

JEPA Policy 将动作块与观测到的未来表征配对作为训练目标,动作与未来表征 token 在共享 Transformer 中交互,经两次前向传播优化。在九个模拟任务中平均成功率优于仅动作基线及 Diffusion Policy,额外延迟仅 0.29 毫秒。五任务 630 轮物理机器人实验同样排名一致。

via
arXiv cs.RO(论文预印本)
风向 · vibes

What practitioners are saying

BLOG
一段视频示范≈380个实操样本,单步成功率66%,是基线7倍
NVIDIA Blog (Robotics)·source ↗
BLOG
AI竞争正从理解世界走向预测世界,世界模型转向预测可行动的未来
雷锋网·source ↗
BLOG
力控技术正成为具身智能竞争新焦点,相关公司三个月两轮融资
Google News · 机器人融资与产品·source ↗
研究启示 · insights

Worth re-reading

世界模型行动化转向

世界模型范式转移、3D高斯泼溅工程化成熟、具身智能产业化压力三股趋势合流,推动世界模型从生成逼真视频转向预测可行动的未来。
雷锋网·source ↗

研究员注:💭 价值锚点从视觉真实移到物理行动闭环,评测基准与真机验证将是关键卡位。

机器人基础模型商业化

Skild AI 宣布年度经常性收入达 1 亿美元,显示其机器人基础模型商业化取得重要进展。
Reddit · r/robotics·source ↗

研究员注:💭 从实验室指标迈向实际收入,单视频学习能力可能成为规模化数据瓶颈的破局点。

实用工具 · ship list

Tools, datasets & models shipped today

  • 机器人基础模型,单视频上下文学习,单步成功率66%适合长时程精细装配场景,注意验证域外泛化
    NVIDIA Blog (Robotics)
  • 从空间、时间、物理、任务四维度评测世界模型世界模型研究团队可纳入评测体系
    雷锋网
今日全部信号 · all sources

Sources of the day

arXiv cs.RO (Robotics)/ Feed
96

ViBe: Visual Behavior Adaptation for Perceptive Humanoid Whole-Body Control

本文提出ViBe,一个后训练框架,用于将人形机器人运动跟踪器适配到感知控制任务。利用预训练视觉编码器和多查询提取器学习任务相关的感知反馈,通过低秩适配器以参数高效方式接入跟踪器输入,可直接通过策略优化进行微调。在四个任务上实现零样本仿真到现实迁移,包括路边行走、跑酷、Repose Cube、全向物体操作和躲避球,并在户外、低光及RGB干扰条件下表现稳健。最后,用简单规划器解决目标导向的Repose Cube任务,验证了所提感知控制器的有效性。

  • 提出ViBe后训练框架,适配人形运动跟踪器至感知控制
  • 利用预训练视觉编码器与多查询提取器学习任务相关反馈
  • 通过低秩适配器实现参数高效微调,支持直接策略优化
humanoidwhole-body controlperceptive control
9月9日
雷锋网/ Feed
95

AI 开始学习「想象未来」:ECCV 2026背后,中国学者如何卡位世界模型

文章报道ECCV 2026上世界模型与具身智能的密集讨论,指出AI竞争正从理解世界走向预测世界。三股趋势合流:世界模型范式转移、3D高斯泼溅工程化成熟、具身智能产业化压力。中国学者从重新定义世界模型(WAM)、建立评测基准(4DWorldBench)、实现真机落地(eWAM、AtomicVLA等)三个方向切入,推动世界模型从生成逼真视频转向预测可行动的未来,并强调物理一致性与行动闭环。

  • ECCV 2026设13个世界模型/具身智能workshop,密度空前
  • 世界模型、3D高斯、具身智能三股趋势首次正式会师
  • 中国学者提出WAM概念,强调预测未来必须进入行动路径
world modelsembodied aivla
9月10日
arXiv cs.RO (Robotics)/ Feed
95

JEPA Policy: Diffusion-Free Imitation Learning via Paired Action and Future Representation Prediction

提出JEPA Policy,一种免扩散的模仿学习框架,将动作块与观测到的未来表征配对作为训练目标。动作与未来表征token在共享Transformer中交互并通过两次前向传播优化,使未来预测塑造动作生成表征。在九个模拟任务中,该方法平均成功率优于仅动作的MIP基线及Diffusion Policy,且仅增加0.29 ms延迟。五任务630轮物理机器人实验同样获得一致排名。研究表明配对未来表征监督是一种实用的低延迟视觉运动模仿方法,无需迭代生成采样。

  • 将动作块与未来表征配对训练,免扩散模仿学习
  • 共享Transformer中动作与未来表征交互优化
  • 九个模拟任务平均成功率超越Diffusion Policy
imitation-learningvisuomotor-policyrobot-manipulation
9月9日
EMBODIED AI DAILY · auto-curated by GPT
Updated daily at 06:00 (your TZ)