中文

永不停止学习:微调在机器人强化学习中的有效性

机器学习 2020-08-03 v2 计算机视觉与模式识别 机器人学 机器学习

摘要

机器人学习系统的一大承诺是它们能从错误中学习并持续适应不断变化的环境。尽管有此潜力,当今大多数机器人学习系统作为固定策略部署,且在部署后未被适应。我们能否高效地将先前习得的行为适应到现实世界中的新环境、物体与感知?本文提出一种促进持续适应的机器人学习框架的方法与经验证据。具体而言,我们展示了如何通过离策略强化学习进行微调,将基于视觉的机器人操作策略适应到新的变化,包括背景、物体形状与外观、光照条件及机器人形态的改变。此外,这种适应所用数据少于从零学习该任务的0.2%。我们发现我们的预训练策略适应方法在微调过程中带来显著性能提升,且通过RL预训练至关重要:从零训练或从有监督ImageNet特征适应在如此少量数据下均不成功。我们还发现这些积极结果在有限的持续学习设定下成立,其中我们使用来自连续新任务的数据反复微调单一策略谱系。我们的经验结论一致得到模拟操作任务实验及真实机器人抓取系统(基于580,000次抓取预训练)上52项独特微调实验的支持。

关键词

引用

@article{arxiv.2004.10190,
  title  = {Never Stop Learning: The Effectiveness of Fine-Tuning in Robotic Reinforcement Learning},
  author = {Ryan Julian and Benjamin Swanson and Gaurav S. Sukhatme and Sergey Levine and Chelsea Finn and Karol Hausman},
  journal= {arXiv preprint arXiv:2004.10190},
  year   = {2020}
}

备注

8.5 pages, 9 figures. See video overview and experiments at https://youtu.be/pPDVewcSpdc and project website at https://ryanjulian.me/continual-fine-tuning