超越视角泛化:多视角演示能提供什么及如何为机器人操作合成它们?
机器人学
2026-03-31 v1
摘要
多视角演示是否真正提升机器人操作,抑或仅增强跨视角鲁棒性?我们进行了一项系统性研究,量化评估了多视角数据对机器人操作的性能提升幅度、规模行为及其背后机制。受控实验表明,在固定背景和随机化背景条件下,多视角演示均一致性地提升了单视角策略的成功率与泛化能力。性能随视角覆盖程度呈非单调变化,揭示了有效运行区间,而非简单“更多即更好”的趋势。值得注意的是,多视角数据打破了单视角数据集的规模瓶颈,在性能饱和后仍持续推动性能上限的提升。机制分析显示,多视角学习促进了与操作相关的视觉表征学习,更好地将动作头部与所学特征分布对齐,并减少了过拟合。针对多视角数据之重要性、大规模机器人数据集中稀缺的现实困境,以及在实际场景中获取额外视角的困难,我们提出了RoboNVS——一种几何感知的自监督框架,用于从单目输入合成新视角视频。生成的数据在仿真和真实环境中均一致性地提升了下游策略的性能。
引用
@article{arxiv.2603.26757,
title = {Beyond Viewpoint Generalization: What Multi-View Demonstrations Offer and How to Synthesize Them for Robot Manipulation?},
author = {Boyang Cai and Qiwei Liang and Jiawei Li and Shihang Weng and Zhaoxin Zhang and Tao Lin and Xiangyu Chen and Wenjie Zhang and Jiaqi Mao and Weisheng Xu and Bin Yang and Jiaming Liang and Junhao Cai and Renjing Xu},
journal= {arXiv preprint arXiv:2603.26757},
year = {2026}
}