基于连续约束插值框架的离线强化学习自动约束策略优化
机器学习
2026-02-02 v1 人工智能
摘要
离线强化学习(RL)依赖策略约束来缓解外推误差,其中约束形式和约束强度至关影响性能。然而,大多数现有方法仅依赖单一约束家族:加权行为克隆、密度正则化或支持约束,缺乏解释其关联性或权衡的统一原则。本文提出连续约束插值(CCI),一种统一的优化框架,这三种约束家族在共同约束谱线上呈现为特殊情况。CCI 框架引入单一插值参数,使约束类型的平滑转换和原则性组合成为可能。基于 CCI,我们开发了自动约束策略优化(ACPO),一种实用的原始-对偶算法,通过拉格朗日对偶更新适应插值参数。此外,我们建立了最大熵性能差不等式,推导了闭式最优策略及其参数化投影的性能下界。在 D4RL 和 NeoRL2 上的实验表明,该方法在 diverse 领域中实现了稳健的性能提升,总体达到了最先进水平。
引用
@article{arxiv.2601.23010,
title = {Automatic Constraint Policy Optimization based on Continuous Constraint Interpolation Framework for Offline Reinforcement Learning},
author = {Xinchen Han and Qiuyang Fang and Hossam Afifi and Michel Marot},
journal= {arXiv preprint arXiv:2601.23010},
year = {2026}
}