异动力学强化学习中少样本迁移的保守方法
机器学习
2024-07-16 v3 机器学习
摘要
异动力学强化学习(ODRL)旨在将策略从源环境迁移到具有不同但相似动力学的目标环境。在此背景下,传统强化学习代理过度依赖源环境的动力学,导致发现的策略在源环境中表现出色,但在目标环境中无法提供合理的性能。在少样本框架中,引入目标环境的少量转移以促进更有效的迁移。针对这一挑战,我们提出了一种创新方法,灵感来自模仿学习和保守强化学习算法的最新进展。所提出的方法引入了一个惩罚项来调节源训练策略生成的轨迹。我们在代表不同异动力学条件的各种环境中评估了我们的方法,这些环境中对目标环境的访问极其有限。这些实验包括与现实世界应用相关的高维系统。在大多数测试场景中,我们的方法相比现有基线展示了性能提升。
引用
@article{arxiv.2312.15474,
title = {A Conservative Approach for Few-Shot Transfer in Off-Dynamics Reinforcement Learning},
author = {Paul Daoudi and Christophe Prieur and Bogdan Robu and Merwan Barlier and Ludovic Dos Santos},
journal= {arXiv preprint arXiv:2312.15474},
year = {2024}
}