通过认知风险寻求策略优化实现高效探索
机器学习
2023-06-06 v2 人工智能
摘要
探索仍然是深度强化学习(RL)中的一个关键挑战。面对不确定性时的乐观主义是一种众所周知的启发式方法,在表格设定下具有理论保证,但如何最好地将这一原则转化为涉及在线随机梯度和深度网络函数逼近器的深度强化学习,尚未被完全理解。在本文中,我们提出了一个新的、可微分的乐观目标,当优化该目标时,会产生一个可证明能高效探索的策略,即使在函数逼近下也能提供保证。我们的新目标是一个零和双人博弈,源于赋予智能体一个认知风险寻求效用函数,该函数将不确定性转化为价值,并鼓励智能体探索不确定的状态。我们证明,该博弈的解最小化了遗憾的一个上界,其中“玩家”各自试图最小化特定遗憾分解的一个组成部分。我们推导出一种新的无模型算法,称之为“认知风险寻求演员-评论家”(ERSAC),它只是将同步随机梯度上升-下降应用于该博弈。最后,我们讨论了一个结合离线数据的方案,并表明将风险寻求目标与重放数据相结合,在统计效率方面带来了双重好处。我们以一些结果作为结论,展示了使用该技术的深度RL智能体在具有挑战性的“DeepSea”环境中的良好性能,显示出即使与其他高效探索技术相比也有显著的性能提升,以及在Atari基准测试上的性能改进。
引用
@article{arxiv.2302.09339,
title = {Efficient Exploration via Epistemic-Risk-Seeking Policy Optimization},
author = {Brendan O'Donoghue},
journal= {arXiv preprint arXiv:2302.09339},
year = {2023}
}