中文

Forager:面向 RL 中部分可观测性持续学习的轻量级测试平台

机器学习 2026-05-05 v1 人工智能

摘要

在持续强化学习 (CRL) 中,良好的性能需要在庞大且部分可观测的世界中进行永不停歇的学习、行动和探索。大多数 CRL 实验都聚焦于塑性损失——即学习能力的丧失——在一次性实验中,其中添加了某种不可观测的非平稳性以经典的完全可观测 MDP 中。进一步地,这些实验很少考虑部分可观测性的作用以及使用记忆或递归的 CRL 智能体的重要性。许多部分可观测 CRL 环境昂贵 prohibitively expensive 的一个潜在原因是。本文介绍 Forager,一个具有恒定记忆占用的轻量级部分可观测 CRL 环境。我们提供一组实验和样本任务,表明 Forager 对当前的 CRL 智能体而既具有挑战性,又允许深入研究这些智能体。我们展示了智能体 exhibits 塑性损失,提出的缓解措施有助于改善,但最有用的是利用状态构建。我们以 Forager 的一个变体结束,该变体生成持续的新任务学习流,清晰地凸显了当前 CRL 智能体的局限性。

关键词

引用

@article{arxiv.2605.01131,
  title  = {Forager: a lightweight testbed for continual learning with partial observability in RL},
  author = {Steven Tang and Xinze Xiong and Anna Hakhverdyan and Andrew Patterson and Jacob Adkins and Jiamin He and Esraa Elelimy and Parham Mohammad Panahi and Martha White and Adam White},
  journal= {arXiv preprint arXiv:2605.01131},
  year   = {2026}
}

备注

24 pages, 11 figures