通过自适应预训练视觉编码器实现高效强化学习
计算机视觉与模式识别
2025-02-11 v1
摘要
尽管强化学习(RL)代理能够成功学习处理复杂任务的能力,但有效地将已获得的技能推广到陌生环境仍是一个挑战。这一原因之一是所使用的视觉编码器是任务依赖性的,阻碍了在不同设置下有效提取特征。为此,近期研究尝试使用多样化视觉输入对编码器进行预训练以提升其性能。然而,这些方法依赖现有的预训练编码器,未进一步探索预训练阶段的影响。本文提出 APE:通过自适应预训练视觉编码器实现高效强化学习——一个框架,在预训练阶段利用自适应数据增强策略,并在策略学习阶段仅通过少量与任务环境的互动即可提取可泛化的特征。我们在多个领域进行实验,包括 DeepMind Control Suite、Atari 游戏和 Memory Maze 基准测试,以验证该方法的有效性。结果表明,诸如 DreamerV3 和 DrQ-v2 等主流 RL 方法配合 APE 可实现最先进的性能。此外,APE 在仅使用视觉输入的情况下显著提高了采样效率,在几个控制任务中接近基于状态的方法的效率。这些发现表明,编码器的自适应预训练在增强视觉 RL 算法的泛化能力和效率方面具有潜力。
引用
@article{arxiv.2502.05555,
title = {Efficient Reinforcement Learning Through Adaptively Pretrained Visual Encoder},
author = {Yuhan Zhang and Guoqing Ma and Guangfu Hao and Liangxuan Guo and Yang Chen and Shan Yu},
journal= {arXiv preprint arXiv:2502.05555},
year = {2025}
}
备注
Accepted by AAAI 2025