中文

通过对抗行为抑制 Q-Learning 中的过高估计

机器学习 2024-10-01 v3 人工智能

摘要

本文旨在提出一种带虚拟对抗玩家的新型 Q-learning 算法,称为虚拟对抗 Q-learning(DAQ),其可有效调节标准 Q-learning 中的过高估计偏差。借助该虚拟玩家,学习可表述为双人零和博弈。所提 DAQ 将若干用于控制过高估计偏差的 Q-learning 变体(如 maxmin Q-learning 与本文提出的 minmax Q-learning)统一于单一框架中。所提 DAQ 是一种通过虚拟对抗行为抑制过高估计偏差的简单而有效方法,并可轻易应用于现成(reinforcement learning)算法以提升性能。通过适配一种对抗 Q-learning,从综合视角分析了 DAQ 的有限时间收敛性。所提 DAQ 的性能在各种基准环境下经实证展示。

关键词

引用

@article{arxiv.2310.06286,
  title  = {Suppressing Overestimation in Q-Learning through Adversarial Behaviors},
  author = {HyeAnn Lee and Donghwan Lee},
  journal= {arXiv preprint arXiv:2310.06286},
  year   = {2024}
}

备注

Annual Allerton 2024