强化学习中基于时间不一致性的自监督探索
机器学习
2023-06-28 v2 人工智能
摘要
在稀疏外部奖励设定下,尽管该领域兴趣激增,强化学习仍然具有挑战性。以往的尝试表明,内在奖励可以缓解由稀疏性引起的问题。在本文中,我们受人类学习启发提出了一种新颖的内在奖励,因为人类通过比较当前观察与历史知识来评估好奇心。我们的方法包括训练一个自监督预测模型、保存模型参数的快照,并使用核范数来评估不同快照预测之间的时间不一致性作为内在奖励。我们还提出了一种变分加权机制,以自适应方式为不同快照分配权重。我们在多种基准环境上的实验结果表明了我们的方法的有效性,其优于其他基于内在奖励的方法,且无需额外训练成本并具有更高的噪声容忍度。本工作已提交给 IEEE 以备可能发表。版权可能在未通知的情况下转让,此后该版本可能不再可访问。
引用
@article{arxiv.2208.11361,
title = {Self-Supervised Exploration via Temporal Inconsistency in Reinforcement Learning},
author = {Zijian Gao and Kele Xu and Yuanzhao Zhai and Dawei Feng and Bo Ding and XinJun Mao and Huaimin Wang},
journal= {arXiv preprint arXiv:2208.11361},
year = {2023}
}