中文

基于连续约束插值框架的离线强化学习自动约束策略优化

机器学习 2026-02-02 v1 人工智能

摘要

离线强化学习(RL)依赖策略约束来缓解外推误差,其中约束形式和约束强度至关影响性能。然而,大多数现有方法仅依赖单一约束家族:加权行为克隆、密度正则化或支持约束,缺乏解释其关联性或权衡的统一原则。本文提出连续约束插值(CCI),一种统一的优化框架,这三种约束家族在共同约束谱线上呈现为特殊情况。CCI 框架引入单一插值参数,使约束类型的平滑转换和原则性组合成为可能。基于 CCI,我们开发了自动约束策略优化(ACPO),一种实用的原始-对偶算法,通过拉格朗日对偶更新适应插值参数。此外,我们建立了最大熵性能差不等式,推导了闭式最优策略及其参数化投影的性能下界。在 D4RL 和 NeoRL2 上的实验表明,该方法在 diverse 领域中实现了稳健的性能提升,总体达到了最先进水平。

关键词

引用

@article{arxiv.2601.23010,
  title  = {Automatic Constraint Policy Optimization based on Continuous Constraint Interpolation Framework for Offline Reinforcement Learning},
  author = {Xinchen Han and Qiuyang Fang and Hossam Afifi and Michel Marot},
  journal= {arXiv preprint arXiv:2601.23010},
  year   = {2026}
}