MDPs中在线学习:部分对抗性转移与损失
机器学习
2026-02-11 v1
摘要
我们研究的是转移函数在大多数步骤为随机,但在每个回合中固定子集 步骤可能表现出对抗性的MDP的强化学习。该模型捕捉了除了少数脆弱点外其他都稳定的环境。我们引入了\emph{条件驻留度量},即使在对抗性转移下也在回合之间保持稳定,并据此设计了两个算法。第一个算法处理任意对抗性步骤,实现的 regret 为 ,其中 为回合数, 为状态数, 为动作数, 为回合时长。第二个算法假设对抗性步骤是连续的,改进了对 的依赖,变为 。我们进一步给出一个 的 regret 归约,消除了需要知道哪些步骤是 个对抗性步骤的需求。我们还在\emph{完全对抗}设置下(即 ) characterize了对抗性MDP的 regret,这种情况下既有完整信息也有 bandit 反馈,提供了近乎匹配的上下界(稍微加强了现有下界,并阐明了不同反馈结构如何影响学习的难度。
引用
@article{arxiv.2602.09474,
title = {Online Learning in MDPs with Partially Adversarial Transitions and Losses},
author = {Ofir Schlisselberg and Tal Lancewicki and Yishay Mansour},
journal= {arXiv preprint arXiv:2602.09474},
year = {2026}
}