中文

损失即其自身的奖励:强化学习的自监督

机器学习 2017-03-10 v2

摘要

强化学习针对期望累积奖励优化策略。监督必须如此狭窄吗?许多任务的奖励是延迟且稀疏的,这使其对于端到端优化成为一个困难且贫乏的信号。为了增强奖励,我们考虑了一系列结合状态、动作和后续状态的自监督任务,以提供辅助损失。这些损失即使在缺乏奖励的情况下,也能为表示学习提供无处不在且即时的监督。尽管当前结果表明仅从奖励学习是可行的,但纯强化学习方法受限于计算与数据效率问题,而这些问题可由辅助损失补救。自监督预训练与联合优化提升了端到端强化学习的数据效率与策略回报。

关键词

引用

@article{arxiv.1612.07307,
  title  = {Loss is its own Reward: Self-Supervision for Reinforcement Learning},
  author = {Evan Shelhamer and Parsa Mahmoudieh and Max Argus and Trevor Darrell},
  journal= {arXiv preprint arXiv:1612.07307},
  year   = {2017}
}