VA-learning:作为Q-learning更高效替代方案的优势值学习
机器学习
2024-09-04 v2
摘要
在强化学习中,优势函数对策略改进至关重要,但通常从学到的Q函数中提取。一个自然的问题是:为何不直接学习优势函数?在本工作中,我们引入VA-learning,它直接使用自举法学习优势函数和价值函数,而无需显式参考Q函数。VA-learning以离策略方式学习,并享有与Q-learning类似的理论保证。得益于对优势函数和价值函数的直接学习,VA-learning在表格实现和Atari-57游戏上的深度RL智能体方面,均比Q-learning提高了样本效率。我们还发现了VA-learning与对决架构之间的紧密联系,这在一定程度上解释了为何对DQN智能体简单的架构改动往往能提升性能。
引用
@article{arxiv.2305.18161,
title = {VA-learning as a more efficient alternative to Q-learning},
author = {Yunhao Tang and Rémi Munos and Mark Rowland and Michal Valko},
journal= {arXiv preprint arXiv:2305.18161},
year = {2024}
}
备注
Accepted to ICML 2023 as a conference paper