面向强化学习的学习式优化器
机器学习
2024-06-05 v3 人工智能
摘要
近年来,通过利用更多数据、计算和多样任务,学习式优化器在监督学习中取得了显著成功,超越了经典的手工设计优化器。强化学习(RL)与监督学习有本质不同,在实践中,即便在简单RL任务中这些学习式优化器也表现不佳。我们研究此现象并识别出两个问题。首先,智能体梯度分布是非独立同分布的,导致元训练低效。此外,由于高度随机的智能体-环境交互,智能体梯度具有高偏差和方差,增加了为RL学习优化器的难度。我们提出流水线训练以及一种具有良好归纳偏置的新型优化器结构来解决这些问题,使得从零开始为强化学习学习一个优化器成为可能。我们表明,尽管仅在玩具任务中训练,我们的学习式优化器能够泛化到Brax中未见的复杂任务。
引用
@article{arxiv.2302.01470,
title = {Learning to Optimize for Reinforcement Learning},
author = {Qingfeng Lan and A. Rupam Mahmood and Shuicheng Yan and Zhongwen Xu},
journal= {arXiv preprint arXiv:2302.01470},
year = {2024}
}
备注
Published at RLC 2024. For code release, see https://github.com/sail-sg/optim4rl