解开循环神经策略中隐含动力学结构
机器学习
2026-02-03 v1
摘要
循环神经策略在部分可观测控制和元强化学习任务中广泛应用。它们能够维护内部记忆并快速适应未见情景,为此在与非循环方法相比展现了卓越的性能。然而,迄今为止,仍未充分理解其卓越泛化和鲁棒性性能背后的根本机制。本研究通过分析在多样化训练方法、模型架构和任务上的循环策略所学习的隐藏状态空间,发现稳定的循环结构在与环境交互时始终会出现。若将策略与环境视为联合的混合动力系统,这些循环结构与动力系统分析中的“极限循环”(limit cycles)具有惊人的相似性。此外,我们发现,这些极限循环的几何结构也与策略的行为具有结构上的对应关系。这些发现为解释循环策略的许多良好属性提供了新的视角:极限循环的出现既稳定了策略的内部记忆,也稳定了与任务相关的环境状态,同时抑制了源自环境不确定性的令人厌恶的变异性;极限循环的几何结构也编码了行为的关系结构,促进了在非平稳环境中更容易实现技能适应。
引用
@article{arxiv.2602.01196,
title = {Unraveling the Hidden Dynamical Structure in Recurrent Neural Policies},
author = {Jin Li and Yue Wu and Mengsha Huang and Yuhao Sun and Hao He and Xianyuan Zhan},
journal= {arXiv preprint arXiv:2602.01196},
year = {2026}
}