中文

AlignIQL:通过约束优化实现隐式 Q 学习中的策略对齐

机器学习 2025-11-06 v2

摘要

隐式 Q 学习(IQL)是离线强化学习的强基准,该方法仅通过分位数回归使用数据集中的动作来学习价值函数。然而,如何从学习到的隐式 Q 函数中恢复隐式策略以及 IQL 为何能利用加权回归进行策略提取尚不明了。IDQL 将 IQL 重新解释为演员-评论家方法并获取隐式策略的权重,但这种权重仅适用于最优价值函数。在本工作中,我们以优化问题的形式提出解决隐式策略寻找问题(IPF)的不同方法。基于该优化问题,我们进一步提出两种实际算法AlignIQL和AlignIQL-hard,它们继承了IQL中解耦演员与评论家的优势,并提供对IQL能使用加权回归进行策略提取的洞见。与IQL和IDQL相比,我们发现该方法保持了IQL的简单性,同时解决了隐式策略寻找问题。在D4RL数据集上的实验结果表明,我们的方法在与其他SOTA离线RL方法的比较中取得了竞争甚至优于的方法。尤其在像Antmaze和Adroit这样的复杂稀疏奖励任务中,我们的方法显著优于IQL和IDQL。

关键词

引用

@article{arxiv.2405.18187,
  title  = {AlignIQL: Policy Alignment in Implicit Q-Learning through Constrained Optimization},
  author = {Longxiang He and Li Shen and Xueqian Wang},
  journal= {arXiv preprint arXiv:2405.18187},
  year   = {2025}
}

备注

32 pages, 1 figure, 13 tables