中文

SigLoMa:从自我中心视觉学习开放世界四足移动操作

机器人学 2026-05-06 v1

摘要

设计一个开放世界的四足移动操作系统极具挑战性。利用外部感知的传统强化学习框架通常存在极端的样本低效和巨大的 sim-to-real 差距。此外,视觉跟踪的固有延迟与精确浮基控制的高频需求存在根本冲突。因此,现有系统严重依赖昂贵的外部动作捕捉和机外计算。为了消除这些依赖,我们提出了 SigLoMa,一个完全机载的、基于自我中心视觉的拾取与放置框架。SigLoMa 的核心是引入了 Sigma Points,这是一种用于外部感知的轻量级几何表示,保证了高可扩展性和原生的 sim-to-real 对齐。为了弥合慢速感知与快速控制之间的频率鸿沟,我们设计了一个自我中心卡尔曼滤波器以提供鲁棒的高速率状态估计。在学习方面,我们通过由提示姿态引导的主动采样课程来缓解样本低效性,并利用时间编码结合模拟随机游走漂移来解决机器人的结构性视觉盲点。真实世界实验验证了,仅依靠 5Hz(200 ms 延迟)的开放词汇检测器,SigLoMa 即可成功执行跨多个任务的动态移动操作,实现了可与专业人类遥操作相媲美的性能。

关键词

引用

@article{arxiv.2605.03846,
  title  = {SigLoMa: Learning Open-World Quadrupedal Loco-Manipulation from Ego-Centric Vision},
  author = {Shiyi Chen and Haiyi Liu and Mingye Yang and Jiaqi Zhang and Debing Zhang},
  journal= {arXiv preprint arXiv:2605.03846},
  year   = {2026}
}

备注

Project website: https://11chens.github.io/SigLoMa/