跳到主内容
5 signals·2 sources·2026年8月21日星期五·08-19 19:37 ~ 08-19 20:00 UTC
今日主线 · main storyline

人形世界模型、跨具身差距与触觉基准

今日论文聚焦鲁棒性评价:GigaBrain-WBC-0.5 用行为世界模型提升人形全身控制,SoftVTBench 用变形感知成功率揭示触觉操控的物理约束,Embodiment Gap 梳理跨本体迁移的适配成本。三者推动评价从成功率转向环境与物理代价。

今日主线集中在「鲁棒性」与「评价有效性」。GigaBrain-WBC-0.5 提出行为世界模型,联合预测动作、状态与行为指令分布,把环境可行性纳入人形全身控制,地形交互成功率达 81.3%,跌倒恢复 99.3%。

另一条线是对成功率的反思:SoftVTBench 用变形感知成功率 DSR 揭示现有策略成功回合中 0.7-24% 存在过度压缩或滑移;The Embodiment Gap 系统梳理跨本体迁移的适配成本。这些工作共同说明,只报成功率会掩盖真实部署问题。

#01

基于因果 Transformer,联合预测下一动作、状态与潜在行为指令分布。自动地形标注恢复三维接触几何,在线检测不合理指令并回退。地形交互成功率 81.3%,跌倒恢复 99.3%,硬件验证缺失支撑与扰动下的鲁棒交互。

via
arXiv cs.RO(论文预印本)
#02

包含 4000 条专家演示、50+ 可变形资产,同步记录多视角 RGB 与双指触觉等。提出变形感知成功率 DSR,要求峰值归一化变形在容差内。现有策略成功回合中 0.7-24% 违反变形容差;分布偏移下视觉-触觉变体多优于纯视觉。

via
Hugging Face Daily Papers(每日论文选)
#03

提出「具身差距」概念,描述策略在不同本体间可复用部分与仍需适配工作的差异。将现有方法映射到二维轴,回顾共享语义感知、数据接口、跨具身对应学习三方向。批评仅用成功率评价跨具身迁移,并提出新报告框架。

via
arXiv cs.RO(综述论文)
风向 · vibes

What practitioners are saying

PAPER
现有策略的成功回合中 0.7-24% 违反变形容差
SoftVTBench·source
PAPER
触觉可用性不等于有效多模态融合
SoftVTBench·source
PAPER
当前研究常以缩放视角讨论VLA等策略的泛化,但实际部署中不同方法所需的适配工作差异显著
The Embodiment Gap·source
研究启示 · insights

Worth re-reading

具身差距:从缩放迷思到适配现实

本文提出「具身差距」概念,即模型、表示或数据在不同机器人本体间可复用的部分与部署到目标机器人时仍需实现的适配工作之间的差距。
The Embodiment Gap in Robot Foundation Models·source

研究员注:💭 仅谈泛化成功会掩盖跨本体迁移的真实成本,新报告框架或能引导更理性的部署预期。

变形感知成功率 DSR

实验显示现有策略的成功回合中 0.7-24% 违反变形容差;分布偏移下视觉-触觉变体在任务成功率和 DSR 上大多更优,但分布内收益不一。
SoftVTBench·source

研究员注:💭 触觉数据并非越多越好,多模态融合是否有效需看场景与分布。

实用工具 · ship list

Tools, datasets & models shipped today

  • 可变形物体操作数据集与基准,含 4000 演示、50+ 资产,提出 DSR 指标。适合评估触觉策略对变形的控制,建议关注 DSR 而非仅成功率。
    SoftVTBench: A Deformation-Aware Visuo-Tactile Dataset and Benchmark
  • 人形机器人行为世界模型,地形交互成功率 81.3%,跌倒恢复 99.3%。可尝试用于鲁棒全身控制,尤其不靠谱指令检测。
    GigaBrain-WBC-0.5
今日全部信号 · all sources

Sources of the day

arXiv cs.RO (Robotics)/ Feed
98

GigaBrain-WBC-0.5: A Behavior World Model for Robust Whole-Body Control with Environment Interaction

提出 GigaBrain-WBC-0.5,首个用于人形机器人全身控制的行为世界模型(BWM)。该模型基于因果 Transformer,联合预测下一动作、状态和潜在行为指令分布,使策略能够理解环境对可行行为的影响。通过自动地形标注管线从现有运动数据中恢复三维接触几何,训练数据覆盖地形与物体交互。部署时利用预测分布在线检测并撤回不合理指令,实现“尽力而为”的任务执行。在四种测试场景中成功率显著超越基线:地形交互 81.3%(4.3 倍)、不合理指令下 83.1%、跌倒恢复 99.3%(16.8 倍)。硬件验证了缺失支撑和扰动下的鲁棒交互,且 Unitree G1 模型可微调迁移至 Maker L01。

  • 首个行为世界模型,联合预测动作、状态与行为指令分布
  • 自动地形标注管线从现有数据恢复 3D 接触几何
  • 在线检测不合理指令并回退到已学习行为
humanoidwhole-body controlworld model
8月19日
arXiv cs.RO (Robotics)/ Feed
96

HarvestPoint-ACT: Explicit Target Selection and Harvest-Point Conditioning for Robotic Fruit Harvesting under Occlusion

本文提出 HarvestPoint-ACT,一种用于遮挡环境下机器人水果采摘的端到端模仿学习方法。该方法利用实例分割和关键点分支显式预测每个可见水果的采摘点,调度器根据遮挡程度和行程距离选择目标,并在每次尝试后重新检测与排序。选中的水果被编码为八维状态输入动作分块 Transformer,包含绝对采摘点、夹爪相对向量、有效性标志和置信度。当目标暂时丢失时,系统保留上一采摘点估计并标记为过期,持续丢失则中止。在冠层模拟环境中,该方法达到 88% 成功率,重度遮挡下为 75%。

  • 显式预测水果实例掩码和采摘点,避免从像素隐式推断
  • 调度器根据遮挡与距离选择目标,每次尝试后动态重排
  • 八维状态编码输入动作分块 Transformer,融合采摘点与置信度
robotic harvestingimitation learningaction chunking transformer
8月19日
arXiv cs.RO (Robotics)/ Feed
95

The Embodiment Gap in Robot Foundation Models

本文调查了机器人基础模型(RFM)中的“具身差距”问题,即模型、表示或数据在不同机器人本体间可复用的部分与部署到目标机器人时仍需实现的适配工作之间的差距。文章指出,当前研究常以缩放视角讨论VLA等策略的泛化,但实际部署中不同方法所需的适配工作差异显著。作者将现有方法映射到二维轴上,展示共享结构类型与执行所需适配阶段,并围绕三个方向回顾近期工作:共享语义与感知、共享机器人数据与接口、学习跨具身对应关系。此外,提出一个超越单纯成功率的适配工作报告框架,以揭示跨具身学习中应关注的工作及未来研究问题。

  • 提出“具身差距”概念,描述模型复用与本体适配之间的工作差异
  • 以二维轴映射共享结构与适配阶段,系统梳理现有方法
  • 回顾三大方向:共享语义感知、数据接口、跨具身对应学习
embodied airobot foundation modelsvla
8月19日
Hugging Face Daily Papers/ Feed
95

SoftVTBench: A Deformation-Aware Visuo-Tactile Dataset and Benchmark for Deformable-Object Manipulation

SoftVTBench 是一个面向可变形物体操作的视觉-触觉数据集与基准,包含 4000 条专家演示和 50 多个资产,同步记录多视角 RGB、双指触觉 RGB、标记运动、本体感觉、语言及夹爪动作,并配有仅评估器可用的有限元状态。基准提出变形感知成功率 DSR,要求任务成功且峰值归一化变形在容差内。实验显示现有策略的成功回合中 0.7-24% 违反变形容差;分布偏移下视觉-触觉变体在任务成功率和 DSR 上大多更优,但分布内收益不一,表明触觉可用性不等于有效多模态融合。

  • 提供同步视觉-触觉数据集,含 4000 演示与 50+ 可变形资产
  • 提出变形感知成功率 DSR,仅统计未超变形容差的成功回合
  • 现有策略成功回合中 0.7-24% 存在过度压缩或滑移
visuo-tactiledeformable-object-manipulationembodied-ai
8月19日
arXiv cs.RO (Robotics)/ Feed
85

Orienteering Problem with Uncertain Time-Varying Rewards: Framework and Benchmark for Everyday Service Robotics

本文提出不确定时变奖励的定向问题(OP-UTVR),放宽传统定向问题中奖励已知的假设,允许智能体从观测中估计奖励动态并预测未来,以实现随机变化和预测误差下的知情路径规划。作者设计三种规划器,在规划视野和在线自适应间取得不同权衡,并推导奖励随机性下的理论性能界。此外,引入一个移动服务机器人基准,机器人在室内行人环境中导航,实验揭示长视野规划与在线自适应结合的有效性及权衡。

  • 提出不确定时变奖励的定向问题 OP-UTVR
  • 允许从观测估计奖励动态并预测未来
  • 三种规划器权衡规划视野与在线自适应
orienteering-problemservice-roboticsmobile-robot
8月19日
EMBODIED AI DAILY · auto-curated by GPT
Updated daily at 06:00 (your TZ)