中文

通过多摄像头视角到单摄像头视角的知识蒸馏学习视觉策略用于机器人操作任务

机器人学 2023-12-05 v2 人工智能

摘要

同时使用多摄像头视角已被证明能够改善视觉策略的泛化能力和性能。然而,真实场景中的硬件成本和设计限制可能使得使用多个摄像头具有挑战性。在本研究中,我们提出了一种新颖的方法,以增强基于视觉的强化学习(RL)算法在机器人操作任务中的泛化性能。我们提出的方法利用一种称为知识蒸馏的技术,其中使用多个摄像头视角训练的预训练“教师”策略引导“学生”策略从单个摄像头视角学习。为了增强学生策略对摄像头位置扰动的鲁棒性,其使用数据增强和极端视角变化进行训练。因此,学生策略学习到鲁棒的视觉特征,使其无论摄像头视角如何都能准确且稳定地定位感兴趣物体。所提方法的效能和效率在仿真和真实环境中进行了评估。结果表明,单视角视觉学生策略能够成功学会抓取和抬起具有挑战性的物体,而仅使用单视角策略时无法做到这一点。此外,学生策略展示了零样本迁移能力,能够在真实场景中针对未见过的视觉配置成功抓取和抬起物体。

关键词

引用

@article{arxiv.2303.07026,
  title  = {Visual-Policy Learning through Multi-Camera View to Single-Camera View Knowledge Distillation for Robot Manipulation Tasks},
  author = {Cihan Acar and Kuluhan Binici and Alp Tekirdağ and Yan Wu},
  journal= {arXiv preprint arXiv:2303.07026},
  year   = {2023}
}

备注

IEEE Robotics and Automation Letters