中文

MDPs中在线学习:部分对抗性转移与损失

机器学习 2026-02-11 v1

摘要

我们研究的是转移函数在大多数步骤为随机,但在每个回合中固定子集 Λ\Lambda 步骤可能表现出对抗性的MDP的强化学习。该模型捕捉了除了少数脆弱点外其他都稳定的环境。我们引入了\emph{条件驻留度量},即使在对抗性转移下也在回合之间保持稳定,并据此设计了两个算法。第一个算法处理任意对抗性步骤,实现的 regret 为 O~(HSΛKSAΛ+1)\tilde{O}(H S^{\Lambda}\sqrt{K S A^{\Lambda+1}}),其中 KK 为回合数,SS 为状态数,AA 为动作数,HH 为回合时长。第二个算法假设对抗性步骤是连续的,改进了对 SS 的依赖,变为 O~(HKS3AΛ+1)\tilde{O}(H\sqrt{K S^{3} A^{\Lambda+1}})。我们进一步给出一个 K2/3K^{2/3} 的 regret 归约,消除了需要知道哪些步骤是 Λ\Lambda 个对抗性步骤的需求。我们还在\emph{完全对抗}设置下(即 Λ=H1\Lambda=H-1) characterize了对抗性MDP的 regret,这种情况下既有完整信息也有 bandit 反馈,提供了近乎匹配的上下界(稍微加强了现有下界,并阐明了不同反馈结构如何影响学习的难度。

关键词

引用

@article{arxiv.2602.09474,
  title  = {Online Learning in MDPs with Partially Adversarial Transitions and Losses},
  author = {Ofir Schlisselberg and Tal Lancewicki and Yishay Mansour},
  journal= {arXiv preprint arXiv:2602.09474},
  year   = {2026}
}