中文

预训练视觉模型用于控制的惊人有效性

计算机视觉与模式识别 2022-08-10 v2 人工智能 机器学习 机器人学

摘要

近年来,预训练表征已成为计算机视觉、自然语言与语音等人工智能应用中一种强有力的抽象。然而,控制的策略学习仍由白板(tabula-rasa)学习范式主导,视觉-运动策略常利用部署环境中的数据从头训练。在此背景下,我们重新审视并研究了预训练视觉表征(尤其是基于大规模计算机视觉数据集训练的表征)在控制中的作用。通过在多样控制领域(Habitat、DeepMind Control、Adroit、Franka Kitchen)的广泛实证评估,我们分离并研究了不同表征训练方法、数据增强与特征层级的重要性。总体而言,我们发现预训练视觉表征在训练控制策略时可具有竞争力,甚至优于真实状态表征。这仅使用了来自标准视觉数据集的域外数据,而未使用来自部署环境的任何域内数据。源代码及更多信息见 https://sites.google.com/view/pvr-control。

关键词

引用

@article{arxiv.2203.03580,
  title  = {The Unsurprising Effectiveness of Pre-Trained Vision Models for Control},
  author = {Simone Parisi and Aravind Rajeswaran and Senthil Purushwalkam and Abhinav Gupta},
  journal= {arXiv preprint arXiv:2203.03580},
  year   = {2022}
}

备注

First two authors contributed equally