稀疏奖励强化学习中用于深度探索的长期访问价值
机器学习
2022-03-04 v2 机器学习
摘要
稀疏奖励下的强化学习仍是一个开放挑战。经典方法依赖通过外在奖励获取反馈来训练智能体,而在外在奖励极少出现的情况下,智能体学习缓慢或根本无法学习。类似地,若智能体还接收到造成目标函数次优模式的奖励,其很可能过早停止探索。较新的方法添加辅助内在奖励以鼓励探索。然而,辅助奖励会导致Q函数的目标非平稳。本文提出一种新方法:(1)利用长期访问计数规划长远的探索动作;(2)通过学习一个独立评估动作探索价值的函数,解耦探索与利用。与现有使用奖励和动力学模型的方法不同,我们的方法是离策略且无模型的。我们进一步提出新的表格环境,用于强化学习探索的基准测试。在经典和新基准上的实证结果表明,所提方法在稀疏奖励环境中优于现有方法,尤其在存在造成目标函数次优模式的奖励时。结果还表明,我们的方法随环境规模增大而优雅地扩展。源代码见https://github.com/sparisi/visit-value-explore
引用
@article{arxiv.2001.00119,
title = {Long-Term Visitation Value for Deep Exploration in Sparse Reward Reinforcement Learning},
author = {Simone Parisi and Davide Tateo and Maximilian Hensel and Carlo D'Eramo and Jan Peters and Joni Pajarinen},
journal= {arXiv preprint arXiv:2001.00119},
year = {2022}
}