超越OOD状态动作:支持跨域离线强化学习
机器学习
2023-06-23 v1
摘要
离线强化学习(RL)旨在仅使用预先收集且固定的数据来学习策略。尽管避免了RL中耗时的在线交互,但它对分布外(OOD)状态动作提出了挑战,且常受训练数据效率低下的困扰。尽管已有诸多努力致力于解决OOD状态动作问题,后者(数据低效)在离线RL中鲜受关注。为此,本文提出跨域离线RL,其假设离线数据包含来自不同转移动态(环境)的额外源域数据,并期望其有助于提升离线数据效率。为此,我们在利用跨域离线数据时,识别出超越常见OOD状态动作问题的OOD转移动态这一新挑战。随后,我们提出方法BOSA,采用两个支持约束目标来解决上述OOD问题。通过在跨域离线RL设定下的广泛实验,我们证明BOSA可大幅提升离线数据效率:仅使用10%的目标数据,BOSA即可达到使用100%目标数据的SOTA离线RL性能的74.4%。此外,我们还展示BOSA可轻松插入基于模型的离线RL与加噪数据增强技术(用于生成源域数据)中,这自然避免了目标域数据与新生成源域数据之间潜在的动态失配。
引用
@article{arxiv.2306.12755,
title = {Beyond OOD State Actions: Supported Cross-Domain Offline Reinforcement Learning},
author = {Jinxin Liu and Ziqi Zhang and Zhenyu Wei and Zifeng Zhuang and Yachen Kang and Sibo Gai and Donglin Wang},
journal= {arXiv preprint arXiv:2306.12755},
year = {2023}
}