多样数据损坏下离线到在线强化学习的鲁棒策略扩展
机器学习
2025-10-17 v2 人工智能
摘要
在离线数据上预训练策略,随后通过在线交互进行微调,即离线到在线强化学习(O2O RL),已成为现实世界强化学习部署的一种有前景的范式。然而,在实际环境中,离线数据集和在线交互通常带有噪声甚至被恶意损坏,严重降低了 O2O RL 的性能。现有工作主要侧重于通过在线探索来缓解离线策略的保守性,而 O2O RL 在数据损坏(包括状态、动作、奖励和动力学)下的鲁棒性仍未被探索。在本工作中,我们观察到数据损坏会导致策略产生重尾行为,从而大幅降低在线探索的效率。为解决此问题,我们将逆概率加权(IPW)引入在线探索策略以缓解重尾性,并提出了一种简单而有效的新方法,称为 :obust olicy pansion。在 D4RL 数据集上的大量实验结果表明,RPEX 在广泛的数据损坏场景下实现了 SOTA 的 O2O 性能。代码发布于 。
引用
@article{arxiv.2509.24748,
title = {Robust Policy Expansion for Offline-to-Online RL under Diverse Data Corruption},
author = {Longxiang He and Deheng Ye and Junbo Tan and Xueqian Wang and Li Shen},
journal= {arXiv preprint arXiv:2509.24748},
year = {2025}
}
备注
39th Conference on Neural Information Processing Systems