中文

超越惩罚:基于扩散模型的离线强化学习中的分布外检测与选择性正则化

机器学习 2026-05-12 v1 人工智能

摘要

离线强化学习(RL)面临对分布外(OOD)动作价值估计过高的关键挑战。现有方法通过惩罚未见样本来缓解此问题,但无法准确识别 OOD 动作,可能抑制行为支持之外的有益探索。尽管提出了多种方法来区分具有不同属性的 OOD 样本,但它们通常依赖于数据分布的限制性假设,且在区分能力上仍有限。为此,我们提出了 DOSER(Diffusion-based OOD Detection and Selective Regularization),一种超越统一惩罚的新型框架。DOSER 训练两个扩散模型来捕获行为策略和状态分布,利用单步去噪重构误差作为可靠的 OOD 指示器。在策略优化过程中,它进一步通过评估预测的状态转移来区分有益和有害的 OOD 动作,选择性地抑制高风险动作,同时鼓励探索高潜力动作。理论上,我们证明了 DOSER 是一个 γ\gamma-contraction,因而具有唯一的固定点且价值估计受控。我们进一步提供了相对于最优策略在模型逼近和 OOD 检测误差下的渐近性能保证。在广泛的离线 RL 基准测试中,DOSER 持续地优于先前方法,尤其在次优数据集上表现更佳。

关键词

引用

@article{arxiv.2605.08202,
  title  = {Beyond Penalization: Diffusion-based Out-of-Distribution Detection and Selective Regularization in Offline Reinforcement Learning},
  author = {Qingjun Wang and Hongtu Zhou and Hang Yu and Junqiao Zhao and Yanping Zhao and Chen Ye and Ziqiao Wang and Guang Chen},
  journal= {arXiv preprint arXiv:2605.08202},
  year   = {2026}
}

备注

10 pages, 5 figures. Accepted to ICLR 2026