中文

面向具身导航的离线视觉表征学习

计算机视觉与模式识别 2022-04-29 v1 机器学习

摘要

对于必须看并移动的具身智能体,我们应如何学习视觉表征?当前的做法是白板式在体学习(tabula rasa in vivo),即从零开始学习视觉表征的同时学习移动,并可能辅以辅助任务(例如预测两个连续观测之间所采取的行动)。在本文中,我们展示了一种替代的两阶段策略远为有效:(1) 使用室内环境的大规模预渲染图像(Omnidata)通过自监督学习(SSL)进行视觉表征的离线预训练,以及 (2) 在长学习周期下通过图像增强在特定任务上对视觉-运动表征进行在线微调。我们称此方法为离线视觉表征学习(OVRL)。我们进行了大规模实验——在 3 个不同的 3D 数据集(Gibson、HM3D、MP3D)、2 个任务(ImageNav、ObjectNav)和 2 种策略学习算法(RL、IL)上——发现 OVRL 表征在现有最佳水平上带来了全面的显著提升:在 ImageNav 上从 29.2% 提升至 54.2%(绝对 +25%,相对 86%),在 ObjectNav 上从 18.1% 提升至 23.2%(绝对 +5.1%,相对 28%)。重要的是,这两个结果均由同一个视觉编码器实现,且该编码器能泛化到预训练期间未见过的数据集。虽然预训练的好处有时在长微调周期下会减弱(或完全消失),但我们发现 OVRL 的性能增益随着智能体被训练 20 亿帧经验而持续增加(而非减少)。

关键词

引用

@article{arxiv.2204.13226,
  title  = {Offline Visual Representation Learning for Embodied Navigation},
  author = {Karmesh Yadav and Ram Ramrakhya and Arjun Majumdar and Vincent-Pierre Berges and Sachit Kuhar and Dhruv Batra and Alexei Baevski and Oleksandr Maksymets},
  journal= {arXiv preprint arXiv:2204.13226},
  year   = {2022}
}

备注

15 pages, 4 figures, 7 tables and supplementary