用双样本检验解决强化学习中的最大化偏差
机器学习
2024-08-13 v4
摘要
基于价值的强化学习算法在游戏、机器人及其他现实应用中展现了强劲表现。过高估计偏差是这些算法的已知威胁,有时会导致严重的性能下降甚至完全的算法失效。我们将该偏差问题从统计角度建模,并将其视为估计一组随机变量的最大期望值(MEV)的实例。我们提出了基于均值双样本检验的 -估计器(TE),它通过调整底层假设检验的显著性水平,灵活地在过高与过低估计之间插值。我们还引入了一种泛化,称为 -估计器(KE),它遵循与 TE 相同的偏差与方差界,并依赖于一个近乎任意的核函数。我们引入了使用 TE 和 KE 的 -Learning 与自举深度 网络(BDQN)的改进版本,并证明了在表格设定下的收敛性。此外,我们提出了一种基于 TE 的 BDQN 的自适应变体,可动态调整显著性水平以最小化绝对估计偏差。所有提出的估计器与算法在多样任务与环境上进行了充分测试与验证,说明了 TE 与 KE 的偏差控制与性能潜力。
引用
@article{arxiv.2201.08078,
title = {Addressing Maximization Bias in Reinforcement Learning with Two-Sample Testing},
author = {Martin Waltz and Ostap Okhrin},
journal= {arXiv preprint arXiv:2201.08078},
year = {2024}
}