中文

稀疏对抗成本下的随机最短路径问题

机器学习 2025-11-04 v1 机器学习

摘要

我们研究在稀疏成本下的对抗性随机最短路径(SSP)问题,考虑完全信息反馈。在已知转移的情况下,现有基于负熵正则化的在线镜像梯度(OMD)方法的上界为 logSA\sqrt{\log SA},其中 SASA 为状态-动作空间的大小。虽然我们表明这在最坏情况下是最优的,但该上界未能捕捉稀疏成本(即仅少数 MSAM \ll SA 个状态-动作对 incurs 成本)带来的收益。事实上,我们还表明负熵在稀疏问题上不可适应,必然导致 logS\sqrt{\log S} 级的 regret。相反,我们提出一族 r\ell_r 范数正则化器(r(1,2)r \in (1,2)),能够适应稀疏性,实现 logM\sqrt{\log M} 级的 regret。我们通过匹配的下界证明了这一点,表明 MM 捕捉了问题的有效维度,而非 SASA。最后,在未知转移情况下,稀疏性的优势有限:我们证明,即便在稀疏问题上,任何学习者的 minimax regret 也随 SASA 多项式增长。

关键词

引用

@article{arxiv.2511.00637,
  title  = {Stochastic Shortest Path with Sparse Adversarial Costs},
  author = {Emmeran Johnson and Alberto Rumi and Ciara Pike-Burke and Patrick Rebeschini},
  journal= {arXiv preprint arXiv:2511.00637},
  year   = {2025}
}