中文

利用快慢后继特征平衡可塑性与稳定性

机器学习 2026-05-28 v2

摘要

智能的一个标志是在非平稳环境中适应的能力,然而深度强化学习(RL)智能体在此类环境中常常表现不佳。先前的研究通过特征或动态的突然转变来引入非平稳性,而现实世界环境通常通过持续的漂移逐渐演变。这种区别对RL中的“稳定性-可塑性困境”具有重要意义,因为突然的任务变化可能比自然主义环境需要更多的可塑性。为了解决这个问题,我们修改了现有的3D Miniworld和MuJoCo环境,以纳入自然主义的、持续的非平稳性,并使用它们来检查在连续环境变化下,稳定性和适应性如何影响性能。我们发现,偏好稳定性的方法,如突触巩固,优于侧重于可塑性的方法,如参数重置。受此结果以及先前关于后继特征(SFs)减少干扰的证据的启发,我们研究了SFs是否是比Q值更好的巩固目标。在这两种环境中,将神经启发的突触巩固应用于SFs在持续变化的环境中产生了优越的性能。此外,当SFs在多个时间尺度上稳定时,巩固最为有效,这些时间尺度捕捉了渐进环境变化的互补方面。总之,这些结果表明,在变化是渐进的情况下,稳定性在持续学习中更为关键,而对预测表示的多时间尺度巩固是一种有效的方法。

关键词

引用

@article{arxiv.2605.26357,
  title  = {Balancing Plasticity and Stability with Fast and Slow Successor Features},
  author = {Raymond Chua and Doina Precup and Blake Richards},
  journal= {arXiv preprint arXiv:2605.26357},
  year   = {2026}
}

备注

Main Paper: 9 pages, 9 figures. Accepted at The International Conference on Machine Learning (ICML) 2026