中文

基于域适应与奖励增强模仿的动态偏移强化学习

机器学习 2024-11-18 v1 人工智能 机器人学

摘要

在动态偏移的情况下,在源域训练策略以部署到目标域具有挑战性,往往导致性能下降。先前的工作通过在源域上使用修改后的奖励来应对这一挑战,该奖励通过匹配源域和目标域最优轨迹之间的分布得出。然而,纯修改奖励仅能确保源域中学习到的策略行为类似于目标最优策略产生的轨迹,这并不能保证当学习到的策略实际部署到目标域时能获得最优性能。在本工作中,我们提出利用模仿学习将从奖励修改中学习到的策略迁移到目标域,使新策略能在目标域中生成相同的轨迹。我们的方法,域适应与奖励增强模仿学习(DARAIL),利用奖励修改进行域适应,并遵循基于观察的生成对抗模仿学习(GAIfO)的一般框架,通过应用奖励增强估计器进行策略优化步骤。理论上,我们在关于动态偏移的温和假设下给出了该方法的误差界,以证明方法的动机。实验上,我们的方法优于不使用模仿学习的纯修改奖励方法,也优于基准离线动态环境中的其他基线方法。

关键词

引用

@article{arxiv.2411.09891,
  title  = {Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation},
  author = {Yihong Guo and Yixuan Wang and Yuanyuan Shi and Pan Xu and Anqi Liu},
  journal= {arXiv preprint arXiv:2411.09891},
  year   = {2024}
}

备注

Published at Neurips 2024