通过对抗行为抑制 Q-Learning 中的过高估计
机器学习
2024-10-01 v3 人工智能
摘要
本文旨在提出一种带虚拟对抗玩家的新型 Q-learning 算法,称为虚拟对抗 Q-learning(DAQ),其可有效调节标准 Q-learning 中的过高估计偏差。借助该虚拟玩家,学习可表述为双人零和博弈。所提 DAQ 将若干用于控制过高估计偏差的 Q-learning 变体(如 maxmin Q-learning 与本文提出的 minmax Q-learning)统一于单一框架中。所提 DAQ 是一种通过虚拟对抗行为抑制过高估计偏差的简单而有效方法,并可轻易应用于现成(reinforcement learning)算法以提升性能。通过适配一种对抗 Q-learning,从综合视角分析了 DAQ 的有限时间收敛性。所提 DAQ 的性能在各种基准环境下经实证展示。
引用
@article{arxiv.2310.06286,
title = {Suppressing Overestimation in Q-Learning through Adversarial Behaviors},
author = {HyeAnn Lee and Donghwan Lee},
journal= {arXiv preprint arXiv:2310.06286},
year = {2024}
}
备注
Annual Allerton 2024