中文

利用中级视觉先验学习导航

计算机视觉与模式识别 2019-12-25 v1 机器学习 神经与进化计算 机器人学

摘要

拥有关于世界的视觉先验(例如世界是三维的)能在多大程度上帮助学习执行下游运动任务(例如导航复杂环境)?在学习中不利用此类视觉先验会有什么后果?我们通过将一套通用感知技能集(距离估计器、边缘检测器等)整合进强化学习框架(见图 1)来研究这些问题。该技能集(“中级视觉”)相较于原始图像,为策略提供了更为处理过的世界状态。我们的大规模研究表明,与从零开始学习和/或使用最先进的视觉与非视觉表征学习方法相比,使用中级视觉可得到学习更快、泛化更好且最终性能更高的策略。我们展示了传统计算机视觉目标在这方面特别有效,并且可便捷地集成到强化学习框架中。最后,我们发现没有任何单一视觉表征对所有下游任务普遍有用,因此我们计算推导出一组任务无关、经优化以支持任意下游任务的表征集。

关键词

引用

@article{arxiv.1912.11121,
  title  = {Learning to Navigate Using Mid-Level Visual Priors},
  author = {Alexander Sax and Jeffrey O. Zhang and Bradley Emi and Amir Zamir and Silvio Savarese and Leonidas Guibas and Jitendra Malik},
  journal= {arXiv preprint arXiv:1912.11121},
  year   = {2019}
}

备注

In Conference on Robot Learning, 2019. See project website and demos at http://perceptual.actor/