中文

线性情境随机最短路径的 regret 保证

机器学习 2025-11-18 v1

摘要

我们定义线性情境随机最短路径(CSSP)的问题,其中在每个回合开始时,学习者观察一个对抗性选择的情境,该情境通过固定但未知的线性函数决定MDP。学习者的目标是在没有对状态转移动力学、损失函数或情境到MDP映射先验知识的情况下,以最小的预期累积损失到达指定目标状态。本文中,我们提出了LR-CSSP算法,达到O~(K2/3d2/3SA1/3B2Tlog(1/δ))\widetilde{O}(K^{2/3} d^{2/3} |S| |A|^{1/3} B_\star^2 T_\star \log (1/ \delta))的regret上界,其中K为回合数,d为情境维度,S和A分别为状态和动作集合,BB_\star界定最优累积损失,TT_\star(学习者未知)界定最优策略到达目标的预期时间。当所有成本均超过min\ell_{\min}时,LR-CSSP的regret为O~(Kd2S3AB3log(1/δ)/min)\widetilde O(\sqrt{K \cdot d^2 |S|^3 |A| B_\star^3 \log(1/\delta)/\ell_{\min}})。与情境有限时长MDP不同,在CSSP情境中,足够的知识不仅导致更高的损失和regret,还可能延长回合甚至导致非终止回合。我们的分析表明,LR-CSSP有效处理连续情境空间,同时确保所有回合在合理时间步数内终止。

关键词

引用

@article{arxiv.2511.12534,
  title  = {Regret Guarantees for Linear Contextual Stochastic Shortest Path},
  author = {Dor Polikar and Alon Cohen},
  journal= {arXiv preprint arXiv:2511.12534},
  year   = {2025}
}