随机最短路径:极小极大、无参数且趋于无 horizon 后悔界
机器学习
2021-12-13 v2
摘要
我们研究随机最短路径(SSP)设定中的学习问题,其中智能体力求最小化在到达目标状态前累积的期望代价。我们设计了一种新颖的基于模型的算法 EB-SSP,它谨慎地偏置经验转移并以探索奖励扰动经验代价,从而诱导出一个乐观的 SSP 问题,其关联的值迭代方案保证收敛。我们证明 EB-SSP 达到了极小极大后悔率 ,其中 为回合次数, 为状态数, 为动作数, 界定了从任意状态出发最优策略的期望累积代价,从而缩小了与下界的差距。有趣的是,EB-SSP 在无需参数(即不需要任何关于 或 的先验知识,其中 界定了从任意状态出发最优策略的期望到达目标时间)的情况下取得了该结果。此外,我们阐明了多种情形(例如正代价,或当可获得 的阶精确估计时的一般代价),其中后悔仅包含对 的对数依赖,从而给出了有限 horizon MDP 设定之外首个(近乎)无 horizon 后悔界。
引用
@article{arxiv.2104.11186,
title = {Stochastic Shortest Path: Minimax, Parameter-Free and Towards Horizon-Free Regret},
author = {Jean Tarbouriech and Runlong Zhou and Simon S. Du and Matteo Pirotta and Michal Valko and Alessandro Lazaric},
journal= {arXiv preprint arXiv:2104.11186},
year = {2021}
}
备注
NeurIPS 2021