中文

强化学习中多稳定性对时域泛化的重要性

机器学习 2026-05-13 v1

摘要

在强化学习 (RL) 中,针对部分可观测马尔可夫决策过程 (POMDPs) 的智能体必须依赖通常编码在循环神经网络 (RNN) 中的记忆来整合过去观察的信息。其中,相关观察与最优动作之间相隔许多时间步的长时程 POMDPs 尤其具有挑战性:训练 suffers from 较差的泛化、严重的样本低效和昂贵的探索成本。理想情况下,训练于短时程的智能体应在任意更长时程下保持最优行为,但目前尚无正式框架来描述何时可实现。为填补这一空白,我们形式化了时域泛化——即策略在所有时程下保持最优——并推导出必要充要条件,实验评估了非线性和可并行 RNN 变体的能力。本文提出了所得理论框架、实证评估以及将 RNN 行为与时域泛化联系起来的动力学解释。我们的分析表明,多稳定性是时域泛化的必要条件,在简单任务中亦为充分条件;更复杂的任务进一步需要瞬态动力学。相比之下,现代可并行架构——即状态空间模型和门控线性 RNN——本构上是单稳态的,因而无法跨时程进行泛化。我们得出结论,多稳定性和瞬态动力学是时域泛化中两个必需且互补的动力学范式,当前没有任何可并行的 RNN 同时具备这两者。因此,设计结合这两种范式的可并行架构成为实现可扩展长时程 RL 的关键方向。

关键词

引用

@article{arxiv.2605.12206,
  title  = {On the Importance of Multistability for Horizon Generalization in Reinforcement Learning},
  author = {Asad Bakija and Florent De Geeter and Julien Brandoit and Pierre Sacré and Guillaume Drion},
  journal= {arXiv preprint arXiv:2605.12206},
  year   = {2026}
}

备注

23 pages, 6 figures