中文

面向离线强化学习的半监督奖励学习

机器学习 2020-12-15 v1 人工智能 机器人学

摘要

在离线强化学习 (RL) 中,智能体使用记录数据集进行训练。这似乎是攻克现实应用最自然的途径,因为在医疗和机器人等领域与环境的交互要么昂贵要么不合伦理。训练智能体通常需要奖励函数,但不幸的是,实践中奖励很少可用,且其工程设计既具挑战又费力。为克服此问题,我们在最小化人类奖励标注的约束下研究奖励学习。我们考虑两类监督:时间步标注与演示。我们提出从有限标注中学习并利用未标注数据的半监督学习算法。在使用模拟机械臂的实验中,我们大幅优于行为克隆,并接近使用真实奖励所达到的性能。我们进一步研究了奖励模型质量与最终策略之间的关系。我们注意到,例如,奖励模型无需完美也能产生有用策略。

关键词

引用

@article{arxiv.2012.06899,
  title  = {Semi-supervised reward learning for offline reinforcement learning},
  author = {Ksenia Konyushkova and Konrad Zolna and Yusuf Aytar and Alexander Novikov and Scott Reed and Serkan Cabi and Nando de Freitas},
  journal= {arXiv preprint arXiv:2012.06899},
  year   = {2020}
}

备注

Accepted to Offline Reinforcement Learning Workshop at Neural Information Processing Systems (2020)