DrM:通过休眠比最小化掌握视觉强化学习
机器学习
2024-02-15 v2 计算机视觉与模式识别
摘要
视觉强化学习(RL)在连续控制任务中已展现出前景。尽管有所进展,当前算法在性能的各个层面——如样本效率、渐近性能以及对随机种子选择的鲁棒性——仍不尽如人意。本文中,我们指出了现有视觉 RL 方法的一个主要缺陷:智能体在训练早期常表现出持续的不活跃,从而限制了其有效探索的能力。基于这一关键观察,我们进一步揭示了智能体倾向于运动性不活跃探索与其策略网络内神经元活动缺失之间的显著关联。为量化此种不活跃,我们采用休眠比作为度量 RL 智能体网络不活跃程度的指标。经验上,我们也认识到休眠比可作为智能体活动水平的独立指示器,而与接收到的奖励信号无关。利用上述洞见,我们引入 DrM,一种通过主动最小化休眠比、利用三大核心机制来引导智能体探索-利用权衡的方法。实验表明,DrM 在三个连续控制基准环境(包括 DeepMind Control Suite、MetaWorld 与 Adroit)中,以无失效种子(共 76 个种子)实现了样本效率与渐近性能的显著提升。最为重要的是,DrM 是首个基于像素观测,在 DeepMind Control Suite 的 Dog 与 Manipulator 域以及 Adroit 中三个灵巧手操纵任务上无需演示即可稳定求解任务的无模型算法。
引用
@article{arxiv.2310.19668,
title = {DrM: Mastering Visual Reinforcement Learning through Dormant Ratio Minimization},
author = {Guowei Xu and Ruijie Zheng and Yongyuan Liang and Xiyao Wang and Zhecheng Yuan and Tianying Ji and Yu Luo and Xiaoyu Liu and Jiaxin Yuan and Pu Hua and Shuzhen Li and Yanjie Ze and Hal Daumé and Furong Huang and Huazhe Xu},
journal= {arXiv preprint arXiv:2310.19668},
year = {2024}
}
备注
Accepted at The Twelfth International Conference on Learning Representations (ICLR 2024)