面向聚合型反馈的 MDP 在随机与对抗损失下的适应
机器学习
2025-10-28 v2 机器学习
摘要
我们研究了在有限时序马尔可夫决策过程 (MDP) 中的在线学习问题,其聚合型反馈模型具有挑战性——学习者仅观察每个回合所产生的累计损失,而非每个状态-动作对的单个损失。尽管先前工作在此设置下仅关注最坏情况分析,但本文是首次提出在随机和对抗环境中均能实现低警戒的双赢 (best-of-both-worlds, BOBW) 算法。我们提出了针对有限时序表格型 MDP 的首个 BOBW 算法。在已知转移概率的情况下,我们的算法在随机环境下实现 警戒,在对抗环境下实现 警戒。重要的是,我们也建立了匹配的下界,表明我们的算法在该设置下是最优的。我们进一步通过纳入基于置信度的技术将方法扩展到未知转移概率的情形。我们的研究方法结合了 FTRL 对占用度量的应用、自绑定技术以及受近期在线最短路径问题进展启发的新型损失估计器。顺便我们还提供了首个个体间隙相关下界,并演示了针对带有聚合型反馈的最短路径问题的近似最优 BOBW 算法。
引用
@article{arxiv.2510.17103,
title = {Adapting to Stochastic and Adversarial Losses in Episodic MDPs with Aggregate Bandit Feedback},
author = {Shinji Ito and Kevin Jamieson and Haipeng Luo and Arnab Maiti and Taira Tsuchiya},
journal= {arXiv preprint arXiv:2510.17103},
year = {2025}
}
备注
49 pages