线性情境随机最短路径的 regret 保证
机器学习
2025-11-18 v1
摘要
我们定义线性情境随机最短路径(CSSP)的问题,其中在每个回合开始时,学习者观察一个对抗性选择的情境,该情境通过固定但未知的线性函数决定MDP。学习者的目标是在没有对状态转移动力学、损失函数或情境到MDP映射先验知识的情况下,以最小的预期累积损失到达指定目标状态。本文中,我们提出了LR-CSSP算法,达到的regret上界,其中K为回合数,d为情境维度,S和A分别为状态和动作集合,界定最优累积损失,(学习者未知)界定最优策略到达目标的预期时间。当所有成本均超过时,LR-CSSP的regret为。与情境有限时长MDP不同,在CSSP情境中,足够的知识不仅导致更高的损失和regret,还可能延长回合甚至导致非终止回合。我们的分析表明,LR-CSSP有效处理连续情境空间,同时确保所有回合在合理时间步数内终止。
引用
@article{arxiv.2511.12534,
title = {Regret Guarantees for Linear Contextual Stochastic Shortest Path},
author = {Dor Polikar and Alon Cohen},
journal= {arXiv preprint arXiv:2511.12534},
year = {2025}
}