面向抗损坏的异步 Q 学习:近最优收敛率
机器学习
2026-05-22 v2 系统与控制
系统与控制
最优化与控制
摘要
我们研究了在存在 adversaries 损坏奖励的情形下,学习折扣、无限期限的强化学习 (RL) 设置中的最优策略的问题。为此,我们开发了一种新颖的鲁棒 Q 学习算法变体,并在具有挑战性的异步抽样模型和时序相关数据的情况下进行分析。尽管存在损坏,我们证明了我们方法的有限时间保证与现有结果相当,最多只会引入一个随损坏样本比例而增大的加法项。我们还建立了信息论下界,揭示了我们的保证是近最优的。值得注意的是,我们的算法对 underlying reward 分布不敏感,为异步 Q 学习提供了首个有限时间鲁棒性保证。我们分析的关键要素是一种针对 almost-martingales 的 refined Azuma-Hoeffding 不等式,该不等式可能在更广泛的 RL 算法研究中具有更广泛的适用性。
引用
@article{arxiv.2509.08933,
title = {Corruption-Tolerant Asynchronous Q-Learning with Near-Optimal Rates},
author = {Sreejeet Maity and Aritra Mitra},
journal= {arXiv preprint arXiv:2509.08933},
year = {2026}
}
备注
To appear at the 43rd International Conference on Machine Learning (ICML)