强化学习中快速自主转移的方法
机器学习
2024-07-31 v1 人工智能
摘要
本文引入一种新颖的强化学习 (RL) 策略,旨在利用来自多个环境的预训练批评家价值函数来促进快速自主转移。不同于需要广泛重新训练或微调的传统方法,我们的方法整合了现有知识,使 RL 代理能够在不要求广泛计算资源的情况下快速适应新环境。我们的贡献包括开发多批评家演员-批评家 (MCAC) 算法、建立其收敛性,并提供实证证据表明其有效性。我们的实验结果显示,MCAC 显著优于基准演员-批评家算法,实现了最高可达 22.76 倍的自主转移速度和更高的奖励累积。这一突破性进展凸显了利用积累的知识在 RL 应用中实现高效适应的潜力。
引用
@article{arxiv.2407.20466,
title = {A Method for Fast Autonomy Transfer in Reinforcement Learning},
author = {Dinuka Sahabandu and Bhaskar Ramasubramanian and Michail Alexiou and J. Sukarno Mertoguno and Linda Bushnell and Radha Poovendran},
journal= {arXiv preprint arXiv:2407.20466},
year = {2024}
}