中文

基于优势函数的离线强化学习 OOD 动作方法

机器学习 2025-10-07 v4

摘要

离线强化学习 (RL) 通过固定数据集学习策略而无需在线交互,但因分布迁移导致对离线分布之外 (OOD) 动作的评估不准确并产生过度估计。现有方法通过保守抑制所有 OOD 动作来缓解此问题,但限制了泛化能力。我们提出基于优势函数的扩散演员-评论家方法 (ADAC),利用类似优势的函数评估 OOD 动作,并用于判别性调制 Q 函数更新。我们的关键洞察是:状态价值函数通常比动作价值函数更可靠地学习;因此我们利用后状态价值间接评估每个动作。我们开发了 PointMaze 环境以清晰可视化优势调制如何有效选择优秀 OOD 动作同时抑制劣质动作。此外,在 D4RL 基准上的大量实验表明,ADAC 实现了最先进的性能,尤其在具有挑战性的任务上取得显著提升。

关键词

引用

@article{arxiv.2505.05126,
  title  = {Taming OOD Actions for Offline Reinforcement Learning: An Advantage-Based Approach},
  author = {Xuyang Chen and Keyu Yan and Wenhan Cao and Lin Zhao},
  journal= {arXiv preprint arXiv:2505.05126},
  year   = {2025}
}