行为先验与动力学模型:提升离线 RL 的性能与域迁移能力
机器学习
2021-06-21 v2
摘要
离线强化学习(RL)旨在从不完美的离线数据中提取近最优策略,而无需额外的环境交互。从多样化离线数据中提取策略,有潜力通过使训练过程更安全、更快速和更流畅来扩展 RL 的适用范围。我们研究如何提升离线 RL 算法的性能、其对离线数据质量的鲁棒性,以及其泛化能力。为此,我们引入基于自适应行为先验的离线模型基 RL(MABE)。我们的算法基于如下发现:支持域内泛化的动力学模型与支持跨域泛化的行为先验是互补的。当二者结合时,它们显著提升了离线 RL 策略的性能和泛化能力。在广泛研究的 D4RL 离线 RL 基准中,我们发现 MABE 相比先前的无模型与基于模型的算法取得了更高的平均性能。在需要跨域泛化的实验中,我们发现 MABE 优于先前的方法。我们的网站位于 https://sites.google.com/berkeley.edu/mabe 。
引用
@article{arxiv.2106.09119,
title = {Behavioral Priors and Dynamics Models: Improving Performance and Domain Transfer in Offline RL},
author = {Catherine Cang and Aravind Rajeswaran and Pieter Abbeel and Michael Laskin},
journal= {arXiv preprint arXiv:2106.09119},
year = {2021}
}