通过序列建模解决离线强化学习中的数据损坏问题
机器学习
2025-03-04 v4 人工智能
摘要
通过离线强化学习从离线数据集中学习策略为数据驱动决策的扩展提供了前景,同时避免了不安全且成本高昂的在线交互。然而,来自传感器或人类的真实数据常常包含噪声和错误,这对现有离线RL方法构成了重大挑战,尤其是在数据有限的情况下。我们的研究发现,专注于基于时序差分学习的主流离线RL方法的先前研究在数据损坏情况下仍不足。相反,我们发现,诸如决策转换器等基础序列建模方法即使无需专门修改,也对数据损坏具有鲁棒性。为充发挥序列建模的潜力,我们提出了鲁棒决策转换器(Robust Decision Rransformer, RDT),通过引入三项简单而有效的鲁棒技术:嵌入丢弃以提高模型对错误输入的鲁棒性,高斯加权学习以减轻损坏标签的影响,以及迭代数据纠正以消除损坏数据。在MuJoCo、厨房和Adroit任务上的大量实验表明,RDT在各种数据损坏情景下均优于先前方法。此外,RDT在将训练时数据损坏与测试时观察扰动组合的更具挑战性的设置下也表现出卓越的鲁棒性。这些结果凸显了序列建模从噪声或损坏的离线数据集中学习的潜力,从而推动了离线强化学习在真实场景中的可靠应用。我们的代码已发布于https://github.com/jiawei415/RobustDecisionTransformer。
引用
@article{arxiv.2407.04285,
title = {Tackling Data Corruption in Offline Reinforcement Learning via Sequence Modeling},
author = {Jiawei Xu and Rui Yang and Shuang Qiu and Feng Luo and Meng Fang and Baoxiang Wang and Lei Han},
journal= {arXiv preprint arXiv:2407.04285},
year = {2025}
}
备注
Accepted by ICLR2025