中文

永不遗忘:通过光流学习平衡探索与利用

机器学习 2019-01-25 v1 人工智能 计算机视觉与模式识别

摘要

在过去几年中,源于环境中状态新颖性的探索奖励已成为激励深度强化学习智能体探索的一种流行方法。近期如好奇心驱动探索等方法通常通过系统动力学模型的预测误差来估计新观测的新颖性。然而,由于模型容量限制及进行下一帧预测的困难,这些方法通常无法在高维观测任务中平衡探索与利用,导致智能体遗忘已访问路径并重复探索那些状态。这种低效的探索行为引起显著的性能下降,尤其在具有稀疏奖励信号的大环境中。在本文中,我们提出引入计算机视觉领域的光流估计概念来处理上述问题。我们提出采用光流估计误差来考察新观测的新颖性,使得智能体能够以更综合的方式记忆和理解已访问状态。我们在若干实验中将我们的方法与先前方法进行比较。我们的结果表明,所提方法似乎比先前方法提供更优且持久的性能。我们进一步对所提方法提供了一组全面的消融分析,并研究了光流估计对 DRL 智能体学习曲线的影响。

关键词

引用

@article{arxiv.1901.08486,
  title  = {Never Forget: Balancing Exploration and Exploitation via Learning Optical Flow},
  author = {Hsuan-Kung Yang and Po-Han Chiang and Kuan-Wei Ho and Min-Fong Hong and Chun-Yi Lee},
  journal= {arXiv preprint arXiv:1901.08486},
  year   = {2019}
}