中文

基于模型的离线强化学习中引入对抗性数据增强

机器学习 2025-03-27 v1 人工智能

摘要

基于模型的离线强化学习(RL)通过离线数据集构建环境模型,以保守的方式进行策略优化。现有方法侧重于通过集成模型学习状态转移,利用保守估计进行滚动预测以缓解外推误差。然而,静态数据使得开发稳健策略具有挑战性,离线智能体无法访问环境以收集新数据。为此,我们提出一种基于模型的离线强化学习方法,引入对抗性数据增强(MORAL)。在MORAL中,我们采用对抗性数据增强代替固定范围的滚动预测,通过集成模型进行交替采样以丰富训练数据。具体而言,该对抗过程动态选择针对策略的集成模型进行有偏采样,从而缓解固定模型的乐观估计,稳健地扩展用于策略优化的训练数据。此外,集成对抗过程中的差分因子进行正则化,确保外推误差的最小化。这种数据增强的优化方法无需滚动预测步长调参,即可适用于多样化的离线任务,显示出卓越的适用性。在D4RL基准上的大量实验表明,MORAL在策略学习和样本效率方面均优于其他模型基准的离线RL方法。

关键词

引用

@article{arxiv.2503.20285,
  title  = {Model-Based Offline Reinforcement Learning with Adversarial Data Augmentation},
  author = {Hongye Cao and Fan Feng and Jing Huo and Shangdong Yang and Meng Fang and Tianpei Yang and Yang Gao},
  journal= {arXiv preprint arXiv:2503.20285},
  year   = {2025}
}