中文

受损奖励下的鲁棒 Q-Learning

机器学习 2024-09-06 v1 系统与控制 系统与控制 最优化与控制 机器学习

摘要

近期,分析无模型强化学习算法非渐近行为的研究激增。然而,此类算法在非理想环境(例如存在受损奖励的情况)中的性能尚不明确。受此空缺启发,我们研究了著名的 Q-learning 算法对强污染攻击模型的鲁棒性,在该模型中,对手可以任意扰动一小部分观测到的奖励。我们首先证明了此类攻击可导致原始 Q-learning 算法产生任意大的误差。随后,我们开发了一种新型鲁棒同步 Q-learning 算法,该算法在每个时间步利用历史奖励数据构建鲁棒经验 Bellman 算子。最后,我们证明了算法的有限时间收敛速率,在没有攻击的情况下,该速率与已知的最先进边界相匹配,仅存在一个与对抗性污染比例 ε\varepsilon 成正比的、不可避免的小 O(ε)O(\varepsilon) 误差项。值得注意的是,即使真实奖励分布具有无限支撑,只要其存在有界的二阶矩,我们的结果依然成立。

关键词

引用

@article{arxiv.2409.03237,
  title  = {Robust Q-Learning under Corrupted Rewards},
  author = {Sreejeet Maity and Aritra Mitra},
  journal= {arXiv preprint arXiv:2409.03237},
  year   = {2024}
}

备注

Accepted to the Decision and Control Conference (CDC) 2024