跳到主内容
7 signals·5 sources·2026年8月19日星期三·08-16 02:59 ~ 08-18 08:58 UTC
今日主线 · main storyline

人形机器人进船厂,记忆与安全成主线

今日具身智能信号从炫技转向找真工作。Persona AI 将船厂焊接定义为人形机器人第一个经济可行岗位,瞄准劳动力瓶颈;arXiv 新模块 Remember Smarter 使 VLA 长程记忆成功率提升;社区 sim-to-real 对比暴露控制短板。行业进入工程验证期。

今天最值得注意的不是新 demo,而是 人形机器人 开始被定义「第一份工作」。Persona AI 选择船厂焊接,因为线性焊缝、毫米级重复动作与可控速度对机器人友好;与 HD Hyundai、POSCO 合作,目标单点部署数百台,说明具身智能商业化正转向可核算的 单位经济性

研究侧同步补课:Remember Smarter 为 VLA 策略加入视觉历史压缩与双曲经验记忆,使 pi0 在 LIBERO-Plus 成功率从 53.6% 升至 70.6%;sim-to-real 对比提醒,机器人错误成本更高,仅堆数据不够,还需不确定性建模与安全边界。

#01

Persona AI 联合创始人 Nic Radford(Persona AI 联合创始人)和 Jerry Pratt(Persona AI 联合创始人)认为,焊接任务对机器人友好:线性焊缝多、速度可控、毫米级重复;船厂复杂地形适合人形双腿。公司与 HD Hyundai、POSCO 合作,目标单点部署数百台,逻辑不是替代人工,而是缓解劳动力瓶颈。技术解读:准静态焊接降低操作难度,是专用场景务实选择。

via
#02

arXiv 新模块 Remember Smarter 针对长程策略上下文受限,用视觉历史压缩与双曲经验记忆两个分支。视觉分支用空间/时序 Mamba 压缩多视角历史,不改变 VLM 视觉 token 流;经验分支用 Poincare VAE 存储成功状态并异步检索。适配 pi0 后 LIBERO-Plus 成功率从 53.6% 升至 70.6%。技术解读:从压缩上下文与分层记忆入手,是长程操作的关键尝试。

via
arXiv cs.RO (Robotics)(预印本论文)
#03

Reddit 社区展示四足机器人 Cubic Doggo 斜坡仿真与现实对比:仿真平稳,现实出现难以控制的摆动,暴露 sim-to-real 迁移的控制差异。帖子包含开源仓库,便于复现。技术解读:sim-to-real gap 在接触丰富、地形变化时被放大,需更鲁棒域随机化或在线辨识。

via
Reddit · r/robotics(社区实测对比)
风向 · vibes

What practitioners are saying

BLOG
人形机器人应瞄准高技能劳动而非普通体力劳动
IEEE Spectrum Robotics·source
DISCUSSION
扩展物理 AI 不能仅靠增加训练数据,机器人还需要具备物理模型、不确定性建模能力
Ali Agha(FieldAI CEO)·source
DISCUSSION
仿真中机器人姿态平稳,而现实中则出现难以控制的摆动以保持平衡
r/robotics 社区用户·source
研究启示 · insights

Worth re-reading

人形机器人先做焊接

认为人形机器人应瞄准高技能劳动而非普通体力劳动。焊接任务对机器人友好:线性焊缝多、速度可控、毫米级重复动作,且船厂劳动力短缺。人形双腿适合船厂复杂地形。
IEEE Spectrum Robotics·source

研究员注:💭 焊接的「重复精度」恰好匹配当前机器人能力,而劳动力短缺提供了商业动机;相比替代人工,其价值更在于提高产能,这是人形机器人落地效率优先的思路。

记忆模块提升长程成功率

在LIBERO-Plus上,适配pi0后总成功率从53.6%提升至70.6%,真实机器人实验验证了记忆保持与经验利用的有效性。
arXiv cs.RO·source

研究员注:💭 将成功状态存入双曲空间并异步检索,不阻塞动作推理,为长程任务提供了一种轻量记忆方案;但还需在更多真实场景验证其泛化性。

实用工具 · ship list

Tools, datasets & models shipped today

  • 视觉历史压缩+双曲经验记忆,即插即用,适配pi0后LIBERO-Plus成功率提升17%。可尝试用于长程操作任务,注意需要历史视觉数据。
    arXiv cs.RO
  • 开源四足机器人斜坡平衡sim-to-real对比,暴露控制差异。适合作为sim-to-real入门案例,复现需注意动力学参数。
    Reddit r/robotics
今日全部信号 · all sources

Sources of the day

arXiv cs.RO (Robotics)/ Feed
95

Remember Smarter: Visual History Compressor and Hyperbolic Experience Space for Robotic Memory

针对长程机器人策略中上下文长度受限的问题,提出即插即用模块Remember Smarter,包含视觉历史压缩和双曲经验记忆两个分支。视觉分支利用双向空间Mamba和因果时序Mamba压缩多视角patch历史,通过残差交叉注意力注入动作隐藏状态,保持VLM视觉token流不变。经验分支将成功的VLM末层状态存入Poincare VAE空间并层次化组织,异步检索转换为测地提示token,不阻塞动作推理。在LIBERO-Plus上,适配pi0后总成功率从53.6%提升至70.6%,真实机器人实验验证了记忆保持与经验利用的有效性。

  • 提出即插即用模块,压缩视觉历史并构建双曲经验记忆
  • 视觉分支用空间/时序Mamba压缩多视角历史,不改变VLM视觉token流
  • 经验分支用Poincare VAE存储成功状态,异步检索不阻塞动作推理
robotic memoryvision-language-actionhyperbolic embedding
8月17日
雷锋网/ Feed
95

共生知行发布人形机器人赛车Demo:以卡丁车测试双足机器人的“全身智能”

具身智能初创公司共生知行发布双足人形机器人驾驶卡丁车Demo,将其定义为一次面向全身智能的综合测试,检验视觉感知、多接触点平衡、手眼脚协同和精细力控。公司定位为面向双足人形机器人的全身智能基座模型公司,探索端到端技术路线。核心成员来自智源、港科大等机构,在VLA、全身运动控制方面有积累。此次Demo为阶段性验证,后续将披露技术细节并推出更多案例。

  • 发布人形机器人驾驶卡丁车Demo,测试全身智能
  • 以卡丁车为压力测试,综合检验平衡、协同与力控
  • 公司定位全身智能基座模型,走端到端技术路线
embodied-aihumanoid-robotvla
8月17日
arXiv cs.RO (Robotics)/ Feed
75

LAPF: LLM-Agent-Based Path Finder Using the UAVScenes Dataset

本文提出 LAPF 框架,将 LLM 智能体用于城镇尺度室外环境中的无人机自主导航。框架集成感知、记忆、规划与行动模块,形成闭环认知架构,利用以往导航经验、思维链推理,并将检测到的每个障碍关联到有界纠正动作,动态调整航点决策。在开放场地与注入障碍场景的测试中,LAPF 平均路径长度分别为 512.83 米和 506.37 米,接近 497.33 米的最优直线路径,路径效率达 97.1% 和 98.1%,相比 CoT 提示显著缩短路径长度,且未出现钳位事件,表现出稳定的近目标导航能力。

  • 提出 LLM 智能体路径规划框架 LAPF,用于无人机室外自主导航
  • 集成感知、记忆、规划、行动模块,形成闭环认知架构
  • 利用思维链推理并将障碍关联到有界纠正动作
uavllm-agentpath-planning
8月17日
EMBODIED AI DAILY · auto-curated by GPT
Updated daily at 06:00 (your TZ)