中文

VA-learning:作为Q-learning更高效替代方案的优势值学习

机器学习 2024-09-04 v2

摘要

在强化学习中,优势函数对策略改进至关重要,但通常从学到的Q函数中提取。一个自然的问题是:为何不直接学习优势函数?在本工作中,我们引入VA-learning,它直接使用自举法学习优势函数和价值函数,而无需显式参考Q函数。VA-learning以离策略方式学习,并享有与Q-learning类似的理论保证。得益于对优势函数和价值函数的直接学习,VA-learning在表格实现和Atari-57游戏上的深度RL智能体方面,均比Q-learning提高了样本效率。我们还发现了VA-learning与对决架构之间的紧密联系,这在一定程度上解释了为何对DQN智能体简单的架构改动往往能提升性能。

关键词

引用

@article{arxiv.2305.18161,
  title  = {VA-learning as a more efficient alternative to Q-learning},
  author = {Yunhao Tang and Rémi Munos and Mark Rowland and Michal Valko},
  journal= {arXiv preprint arXiv:2305.18161},
  year   = {2024}
}

备注

Accepted to ICML 2023 as a conference paper