面向马尔可夫数据的对抗鲁棒 TD 学习:有限时间收敛率与基本极限
机器学习
2025-02-10 v1 系统与控制
系统与控制
最优化与控制
摘要
强化学习 (RL) 中最基本的问题之一是策略评估:估计给定固定策略对应的长期回报,即价值函数。著名的时序差 (TD) 学习算法解决了这一问题,最近的研究探讨了该算法及其变体的有限时间收敛保证。然而,这些保证依赖于奖励观测始终来自良好行为(例如,子高斯)的真实奖励分布。为了回应现实环境中可能不成立的理想化假设,我们从对抗鲁棒性角度重新审视策略评估问题。具体而言,我们考虑 Huber 受污染的奖励模型,其中对手可以在以小概率 对每个奖励样本进行任意篡改。 在此观察模型下,我们首先指出,对手可以导致纯 TD 算法收敛到任意价值函数。随后,我们发展了一种名为 Robust-TD 的新型算法,并证明其有限时间保证与纯 TD 运用线性函数逼近的性能相当,仅多出一个能捕捉篡改影响的小 项。我们进一步给出 minimax 下界,揭示此类加法性篡改诱导项不可避免。据我们了解,这些结果是首次在对 TD 由马尔可夫噪声驱动的随机逼近方案对抗鲁棒性背景下报道的。我们新技术工具的关键是分析受污染、时相关数据的中位数-of-means估计器,这可能对稳健统计学文献也具有独立的兴趣。
引用
@article{arxiv.2502.04662,
title = {Adversarially-Robust TD Learning with Markovian Data: Finite-Time Rates and Fundamental Limits},
author = {Sreejeet Maity and Aritra Mitra},
journal= {arXiv preprint arXiv:2502.04662},
year = {2025}
}
备注
Accepted to AISTATS 2025