中文

DOMAIN:温和保守的基于模型的离线强化学习

机器学习 2025-06-10 v4 人工智能

摘要

基于模型的强化学习(RL)从离线数据集中学习环境模型并生成更多分布外模型数据,已成为解决离线 RL 中分布偏移问题的有效途径。由于所学环境与实际环境之间存在差距,算法中应引入保守性以平衡准确的离线数据与不精确的模型数据。当前算法的保守性主要依赖模型不确定性估计。然而,不确定性估计不可靠,在某些场景下导致性能不佳,且以往方法忽视了模型数据间的差异,带来了过度的保守性。针对上述 issues,本文提出一种不估计模型不确定性的温和保守基于模型离线 RL 算法(DOMAIN),并设计了模型样本的自适应采样分布,可自适应调整模型数据惩罚。本文从理论上证明,DOMAIN 在区域外学到的 Q 值是真实 Q 值的下界,DOMAIN 比以往的基于模型的离线 RL 算法保守性更弱,且具有安全策略改进的保证。大量实验结果表明,DOMAIN 优于先前的 RL 算法,在 D4RL 基准上平均性能提升 1.8%。

关键词

引用

@article{arxiv.2309.08925,
  title  = {DOMAIN: MilDly COnservative Model-BAsed OfflINe Reinforcement Learning},
  author = {Xiao-Yin Liu and Xiao-Hu Zhou and Mei-Jiang Gui and Guo-Tao Li and Xiao-Liang Xie and Shi-Qi Liu and Shuang-Yi Wang and Qi-Chao Zhang and Biao Luo and Zeng-Guang Hou},
  journal= {arXiv preprint arXiv:2309.08925},
  year   = {2025}
}

备注

Accepted by IEEE Transactions on Systems, Man, and Cybernetics: Systems