中文

离线强化学习中的时限缩减:信息损失视角

机器学习 2026-01-06 v1

摘要

时限缩减是离线强化学习(RL)中常见的设计策略,用于缓解长期信用分配、提高稳定性,并通过截断 rollout、分窗训练或层次分解实现可扩展学习(Levine 等,2020;Prudencio 等,2023;Park 等,2025)。尽管最近的实证研究表明,时限缩减在解决具有挑战性的离线 RL 基准问题时可提升可扩展性,但其理论含义仍未得到充分发展(Park 等,2025)。本文我们表明,时限缩减会在离线 RL 中引起根本性且不可恢复的信息损失。我们将时限缩减形式化为从固定长度 trajectory 片段中进行学习,并证明在该范式下且仅限于固定长度 trajectory 片段的任何学习接口下,最优策略可能在统计上与次优策略难以区分,即便拥有无限数据和完美函数逼近。通过一组最小反例马尔可夫决策过程(MDP),我们识别出三种 distinct 结构性失效模式:(i)前缀不可区分导致可辨识性失败,(ii)因截断回报导致目标误规格,(iii)离线数据支持和表示别名。我们的结果确立了时限缩减在安全情况下所必需的条件,并揭示了无法被算法改进克服的内在局限性,补充了针对离线 RL 不同难题轴向的算法工作(Fujimoto 等,2019;Kumar 等,2020;Gulcehre 等,2020)。

关键词

引用

@article{arxiv.2601.00831,
  title  = {Horizon Reduction as Information Loss in Offline Reinforcement Learning},
  author = {Uday Kumar Nidadala and Venkata Bhumika Guthi},
  journal= {arXiv preprint arXiv:2601.00831},
  year   = {2026}
}

备注

13 pages, 3 figures