行动中的视觉:从人类演示中学习主动感知
机器人学
2025-06-19 v1
摘要
我们提出了Vision in Action (ViA),一种用于双手机器人操作的主动感知系统。ViA直接从人类演示中学习任务相关的主动感知策略(例如搜索、跟踪和聚焦)。在硬件方面,ViA采用一种简单而有效的6自由度机器人颈部,实现类似人类的灵活头部运动。为捕捉人类主动感知策略,我们设计了基于VR的遥操作界面,在机器人与人类操作员之间创建共享的观察空间。为缓解因机器人物理运动延迟导致的VR运动恶心,界面使用中间3D场景表示,使操作员端能够实时渲染视图,同时异步更新包含机器人最新观察的场景。通过这些设计元素,ViA能够为三个涉及视觉遮挡的复杂多阶段双手操作任务学习出鲁棒的视觉-运动策略,显著优于基线系统。
引用
@article{arxiv.2506.15666,
title = {Vision in Action: Learning Active Perception from Human Demonstrations},
author = {Haoyu Xiong and Xiaomeng Xu and Jimmy Wu and Yifan Hou and Jeannette Bohg and Shuran Song},
journal= {arXiv preprint arXiv:2506.15666},
year = {2025}
}