中文

AltNet:解决强化学习中的塑性-稳定性困境

机器学习 2026-03-10 v3 人工智能

摘要

人工神经网络在使用固定数据集进行单一任务监督学习时表现出色。然而,当神经网络在强化学习任务中训练时,其从新经验中继续学习的能力随时间而衰减。这种对学习能力的衰减称为塑性损失。为了恢复塑性,先前的工作探索了周期性重置学习网络参数的策略,这种策略通常会提高性能。然而,这些重置往往会导致性能的暂时下降,在实际应用场景中可能具有风险。为克服这种不稳定性,我们引入了AltNet,这是一种基于重置的方法,通过利用一对双神经网络来恢复塑性而不会产生性能下降。双网络的使用通过一种允许网络定期交替角色的机制来锚定重置期间的性能:一个网络在环境中作为学习者发挥作用,而另一个网络则通过回放缓冲区从活跃网络的交互中进行离策略学习。在固定间隔时,活跃网络被重置,而已从 prior 经验中学习的被动网络则成为新的活跃网络。AltNet恢复了塑性,提高了样本效率并实现了更高的性能,同时避免了在安全关键环境中可能引发的性能下降。我们在DeepMind Control Suite中的几个高维控制任务中展示了这些优势,AltNet在各种相关基线方法以及最新技术的基础上均表现出色。

关键词

引用

@article{arxiv.2512.01034,
  title  = {AltNet: Addressing the Plasticity-Stability Dilemma in Reinforcement Learning},
  author = {Mansi Maheshwari and John C. Raisbeck and Bruno Castro da Silva},
  journal= {arXiv preprint arXiv:2512.01034},
  year   = {2026}
}