中文

SECANT:用于视觉策略零样本泛化的自专家克隆

机器学习 2021-06-18 v1 人工智能 计算机视觉与模式识别 机器人学

摘要

泛化一直是强化学习(RL)中的一个长期挑战。尤其是视觉 RL,很容易在高维观测空间中被无关因素分散注意力。本文考虑鲁棒策略学习,目标是零样本泛化到具有较大分布偏移的未知视觉环境。我们提出 SECANT,一种新颖的自专家克隆技术,利用两阶段图像增强将鲁棒表征学习与策略优化解耦。具体而言,首先通过 RL 从零开始以弱增强训练专家策略;随后学生网络通过强增强的监督学习模仿专家策略,使其表征比专家对视觉变化更鲁棒。大量实验表明,SECANT 在 4 个具有挑战性领域的零样本泛化中显著推进了最先进水平。相较先前 SOTA 的平均奖励提升为:DeepMind Control(+26.5%)、机器人操纵(+337.8%)、基于视觉的自动驾驶(+47.7%)和室内物体导航(+15.8%)。代码与视频见 https://linxifan.github.io/secant-site/。

关键词

引用

@article{arxiv.2106.09678,
  title  = {SECANT: Self-Expert Cloning for Zero-Shot Generalization of Visual Policies},
  author = {Linxi Fan and Guanzhi Wang and De-An Huang and Zhiding Yu and Li Fei-Fei and Yuke Zhu and Anima Anandkumar},
  journal= {arXiv preprint arXiv:2106.09678},
  year   = {2021}
}

备注

ICML 2021. Website: https://linxifan.github.io/secant-site/