中文

离线强化学习中策略约束的自适应缩放

机器学习 2026-04-30 v2

摘要

离线强化学习 (RL) 使得无需任何环境交互即可从固定数据集中学习有效策略。现有方法通常采用策略约束来缓解离线 RL 训练期间遇到的分布偏移。然而,由于约束的规模在不同质量和不同任务的数据集中存在差异,现有方法必须精心调整超参数以匹配每个数据集,这既耗时又往往不切实际。我们提出了策略约束的自适应缩放 (ASPC),这是一个二阶可微框架,能够在训练期间动态平衡 RL 与行为克隆 (BC)。我们从理论上分析了其性能提升保证。在四个 D4RL 领域的 39 个数据集上的实验中,采用单一超参数配置的 ASPC 优于其他自适应约束方法以及需要针对每个数据集进行调优的 SOTA 离线 RL 算法,同时仅产生极小的计算开销。代码将在 https://github.com/Colin-Jing/ASPC 发布。

关键词

引用

@article{arxiv.2508.19900,
  title  = {Adaptive Scaling of Policy Constraints for Offline Reinforcement Learning},
  author = {Tan Jing and Xiaorui Li and Chao Yao and Xiaojuan Ban and Yuetong Fang and Renjing Xu and Zhaolin Yuan},
  journal= {arXiv preprint arXiv:2508.19900},
  year   = {2026}
}