Fast TRAC:面向持续强化学习的参数自由优化器
机器学习
2024-10-31 v3 人工智能
摘要
持续强化学习中的关键挑战是“塌陷”,即先前的学习进展会阻碍代理人对新任务的适应。虽然正则化和重置有助于解决此问题,但它们需要一开始就进行精确的超参数选择,并且依赖于环境。基于在线凸优化的原则理论,我们提出了持续强化学习的参数自由优化器,称为 TRAC,其无需调参或对分布迁移进行先验了解。在 Procgen、Atari 和 Gym Control 环境中进行的大量实验表明,TRAC 效果出色——尽管底层优化问题是非凸且非平稳的,TRAC 仍能显著缓解塌陷现象,并快速适应挑战性的分布迁移。
引用
@article{arxiv.2405.16642,
title = {Fast TRAC: A Parameter-Free Optimizer for Lifelong Reinforcement Learning},
author = {Aneesh Muppidi and Zhiyu Zhang and Heng Yang},
journal= {arXiv preprint arXiv:2405.16642},
year = {2024}
}
备注
Code and Website: https://computationalrobotics.seas.harvard.edu/TRAC/