重新审视视觉强化学习中的可塑性:数据、模块与训练阶段
机器学习
2024-05-21 v3 人工智能
摘要
可塑性,即神经网络随新数据演化的能力,对高性能且样本高效的视觉强化学习(VRL)至关重要。尽管重置与正则化等方法可能缓解可塑性损失,但 VRL 框架内各组件对智能体可塑性的影响仍知之甚少。本文针对三个主要未被充分探索的方面开展系统性实证探索,得出如下深刻结论:(1)数据增强对维持可塑性必不可少;(2)评论家(critic)的可塑性损失是阻碍高效训练的主要瓶颈;(3)若不在早期阶段及时干预以恢复评论家的可塑性,其损失将变为灾难性的。这些见解提出了一种解决高回放比(RR)困境的新策略,该困境中加剧的可塑性损失阻碍了由提高复用频率带来的样本效率潜在提升。我们提出自适应 RR(Adaptive RR),而非为整个训练过程设定静态 RR,其基于评论家的可塑性水平动态调整 RR。大量评估表明,Adaptive RR 不仅避免早期阶段的灾难性可塑性损失,还受益于后期阶段更频繁的复用,从而取得更优的样本效率。
引用
@article{arxiv.2310.07418,
title = {Revisiting Plasticity in Visual Reinforcement Learning: Data, Modules and Training Stages},
author = {Guozheng Ma and Lu Li and Sen Zhang and Zixuan Liu and Zhen Wang and Yixin Chen and Li Shen and Xueqian Wang and Dacheng Tao},
journal= {arXiv preprint arXiv:2310.07418},
year = {2024}
}
备注
ICLR 2024 poster