细胞必须继续:基于 Agar.io 的持续强化学习平台
机器学习
2026-03-10 v2 人工智能
摘要
持续强化学习 (RL) 指代理力需要持续学习,而不是收敛到一个随后被固定用于评估的策略。这种设置非常适合代理感知随时间变化的环境,任何静态策略都将失效。在持续 RL 中,研究者通常通过修改包含任务迁移的episodic环境来模拟此类变化,或设计显式建模持续动态的模拟器。然而,将episodic问题转化为continual问题主要捕捉数据流出现突然变化的场景,仍依赖于episodic结构。此外,少数为经验性持续 RL 研究设计的模拟器在范围或复杂度上通常受限。本文引入 AgarCL,一个用于持续 RL 的研究平台,使代理能够逐步达到越来越复杂的行为。AgarCL 基于游戏 Agar.io,是一个非episodic、高维问题,具有随机、不断演化的动态、连续动作和部分可观测性。我们在主要持续 RL 挑战上提供 DQN、PPO 和 SAC 的基准结果,并在 AgarCL 套件中的多个小型任务上进行测试。这些小型任务孤立环境的各个组成部分,允许我们刻画不同游戏组件所提出的挑战。我们进一步评估了三个持续学习方法——Shrink and Perturb、ReDo 和 Continual Backpropagation——并观察到它们与标准 RL 算法几乎没有改进,暗示 AgarCL 所提出的挑战超出了稳定性-塑性困境。
引用
@article{arxiv.2505.18347,
title = {The Cell Must Go On: Agar.io for Continual Reinforcement Learning},
author = {Mohamed A. Mohamed and Kateryna Nekhomiazh and Vedant Vyas and Marcos M. Jose and Andrew Patterson and Marlos C. Machado},
journal= {arXiv preprint arXiv:2505.18347},
year = {2026}
}