中文

多样数据损坏下离线到在线强化学习的鲁棒策略扩展

机器学习 2025-10-17 v2 人工智能

摘要

在离线数据上预训练策略,随后通过在线交互进行微调,即离线到在线强化学习(O2O RL),已成为现实世界强化学习部署的一种有前景的范式。然而,在实际环境中,离线数据集和在线交互通常带有噪声甚至被恶意损坏,严重降低了 O2O RL 的性能。现有工作主要侧重于通过在线探索来缓解离线策略的保守性,而 O2O RL 在数据损坏(包括状态、动作、奖励和动力学)下的鲁棒性仍未被探索。在本工作中,我们观察到数据损坏会导致策略产生重尾行为,从而大幅降低在线探索的效率。为解决此问题,我们将逆概率加权(IPW)引入在线探索策略以缓解重尾性,并提出了一种简单而有效的新方法,称为 RPEX\textbf{RPEX}R\textbf{R}obust P\textbf{P}olicy EX\textbf{EX}pansion。在 D4RL 数据集上的大量实验结果表明,RPEX 在广泛的数据损坏场景下实现了 SOTA 的 O2O 性能。代码发布于 \href\href{https://github.com/felix-thu/RPEX}{https://github.com/felix-thu/RPEX}

关键词

引用

@article{arxiv.2509.24748,
  title  = {Robust Policy Expansion for Offline-to-Online RL under Diverse Data Corruption},
  author = {Longxiang He and Deheng Ye and Junbo Tan and Xueqian Wang and Li Shen},
  journal= {arXiv preprint arXiv:2509.24748},
  year   = {2025}
}

备注

39th Conference on Neural Information Processing Systems