中文

χ₀:通过驯服分布不一致性实现资源感知的鲁棒操作

机器人学 2026-03-18 v3 计算机视觉与模式识别

摘要

高可靠性的长时程机器人操作传统上依赖大规模数据和计算来理解复杂的现实世界动态。然而,我们发现,现实世界鲁棒性的主要瓶颈不仅仅是资源规模,还包括人类演示分布、策略学习到的归纳偏差以及测试时执行分布之间的分布偏移——这种系统性的不一致性会导致多阶段任务中的复合误差。为了缓解这些不一致性,我们提出了χ₀,一个资源高效的框架,其中包含旨在实现机器人操作生产级鲁棒性的有效模块。我们的方法建立在三个技术支柱之上:(i) 模型算术,一种权重空间合并策略,能够高效地吸收不同演示(从物体外观到状态变化)的多样分布;(ii) 阶段优势,一种阶段感知的优势估计器,提供稳定、密集的进度信号,克服了先前非阶段方法的数值不稳定性;以及 (iii) 训练-部署对齐,通过时空增强、启发式 DAgger 校正和时间分块平滑来弥合分布差距。χ₀ 使两套双臂机器人能够协同编排长时程衣物操作,涵盖从展平、折叠到悬挂不同衣物的任务。我们的方法展现出高可靠性的自主性;我们能够从任意初始状态连续不间断地运行系统 24 小时。实验验证,χ₀ 在成功率上比最先进的 π₀.₅ 提高了近 250%,且仅需 20 小时数据和 8 块 A100 GPU。代码、数据和模型将发布以促进社区发展。

关键词

引用

@article{arxiv.2602.09021,
  title  = {$\chi_{0}$: Resource-Aware Robust Manipulation via Taming Distributional Inconsistencies},
  author = {Checheng Yu and Chonghao Sima and Gangcheng Jiang and Hai Zhang and Haoguang Mai and Hongyang Li and Huijie Wang and Jin Chen and Kaiyang Wu and Li Chen and Lirui Zhao and Modi Shi and Ping Luo and Qingwen Bu and Shijia Peng and Tianyu Li and Yibo Yuan},
  journal= {arXiv preprint arXiv:2602.09021},
  year   = {2026}
}