ADG:面向抗损坏离线强化学习的环境扩散引导数据集恢复
机器学习
2025-06-06 v2 人工智能
摘要
从传感器或人工输入收集的真实世界数据集容易受到噪声和错误的影响,这给离线强化学习(RL)的应用带来了巨大挑战。虽然现有方法在处理损坏的动作和奖励方面取得了进展,但在处理高维状态空间中的损坏以及数据集中多个元素同时损坏的情况时仍然不足。扩散模型以其强大的去噪能力而闻名,为该问题提供了有前景的方向,但其倾向于过拟合噪声样本的特性限制了其直接适用性。为了克服这一问题,我们提出了环境扩散引导数据集恢复(ADG),这是一种开创性地使用扩散模型来解决离线 RL 中数据损坏问题的新方法。首先,我们从近似分布中引入环境去噪扩散概率模型(DDPM),这使得在部分损坏的数据集上进行学习具有理论保证。其次,我们利用 Ambient DDPM 的噪声预测特性来区分干净数据和损坏数据,然后使用干净子集来训练标准 DDPM。第三,我们使用训练好的标准 DDPM 来优化先前识别出的损坏数据,从而提高后续离线 RL 训练的数据质量。ADG 的一个显著优势在于其通用性——它可以与任何离线 RL 算法无缝集成。在包括 MuJoCo、Kitchen 和 Adroit 在内的多个基准测试上的实验表明,ADG 有效减轻了损坏数据的影响,并在各种噪声设置下提高了离线 RL 的鲁棒性,取得了 state-of-the-art 的结果。
引用
@article{arxiv.2505.23871,
title = {ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning},
author = {Zeyuan Liu and Zhihe Yang and Jiawei Xu and Rui Yang and Jiafei Lyu and Baoxiang Wang and Yunjian Xu and Xiu Li},
journal= {arXiv preprint arXiv:2505.23871},
year = {2025}
}