中文

别忘了评判员:基于价值的多循环持续强化学习中的数据排练

机器学习 2026-05-22 v1 人工智能

摘要

数据排练已成为缓解持续强化学习(CRL)中灾难性遗忘的主要方法之一。然而,现有工作仅限于策略梯度框架,对评判器进行正则化,因为评判器的正则化会导致性能下降。这种以演员为中心的方法忽略了数据排练对价值函数近似的潜在价值。此外,现有的 CRL 评估很少考虑任务序列重复的多循环环境,这是一种关键的现实场景,会加剧遗忘和塑性问题。我们在深度 Q 网络中使用 Q 值正则化进行数据排练,探讨了多循环设置,并提出 Qreg+NWLU 引入两个简单修改:(1)持续数据排练,通过动态收集和更新存储的 Q 值来实现;(2)“不等待”正则化,即在第一个任务之后立即应用。总的来说,这些修改在价值函数近似设置下提高了学习效率、遗忘缓解和知识传递,相对于 Qreg 和常规 CRL 方法。

关键词

引用

@article{arxiv.2605.22454,
  title  = {Don't Forget the Critic: Value-Based Data Rehearsal for Multi-Cyclic Continual Reinforcement Learning},
  author = {Benjamin Poole and Andrew Quinn and Li Yang and Minwoo Lee},
  journal= {arXiv preprint arXiv:2605.22454},
  year   = {2026}
}