中文

凝视、聚焦、行动:通过人类凝视和聚焦视觉变换实现高效稳健的机器人学习

机器人学 2025-09-23 v2 人工智能 计算机视觉与模式识别

摘要

人类视觉是由凝视驱动的高度活跃的过程,通过聚焦将注意力定向到任务相关区域,显著降低视觉处理。相比之下,机器人学习系统通常依赖被动、均匀的原始相机图像处理。本文探讨了将人类类似的主动凝视纳入机器人策略中以提高效率和鲁棒性的方法。我们开发了GIAVA(Gaze Integrated Active-Vision ALOHA),一种模仿人类头部和颈部运动、进行凝视调整以进行聚焦处理的机器人视觉系统。扩展AV-ALOHA机器人平台,我们引入了一个框架,用于同时收集眼动追踪、视角控制和机器人操控演示数据。我们也开源了一个用于训练集成人类凝视的机器人策略的仿真基准和数据集。灵感来自最近在聚焦图像分割和Vision Transformer在机器人学习中广泛应用的工作,我们将凝视信息集成到Vision Transformer中,使用聚焦块标记方案。与均匀块标记相比,这显著减少了标记数量,从而降低了计算开销。我们的结果表明,此方法在机器人视觉方面大幅降低了计算开销,并提高了对背景干扰的鲁棒性。值得注意的是,在某些高精度任务中,聚焦视觉也能提高性能,表现为更高的成功率。总体而言,这些发现表明,人类启发的聚焦视觉处理潜在力量尚未被充分挖掘,应进一步视为机器人视觉系统中有用的归纳偏置。https://ian-chuang.github.io/gaze-av-aloha/

关键词

引用

@article{arxiv.2507.15833,
  title  = {Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers},
  author = {Ian Chuang and Jinyu Zou and Andrew Lee and Dechen Gao and Iman Soltani},
  journal= {arXiv preprint arXiv:2507.15833},
  year   = {2025}
}

备注

Project page: https://ian-chuang.github.io/gaze-av-aloha/