面向最大似然逆强化学习的双层保守Q学习框架——BiCQL-ML
机器学习
2025-12-01 v1 机器人学
摘要
离线逆强化学习(IRL)旨在仅使用固定演示数据、无需额外在线交互的情况下恢复解释专家行为的奖励函数。我们提出BiCQL-ML,一种无需显式策略学习的策略自由离线IRL算法,该方法在双层框架中联合优化奖励函数和保守Q函数。该方法交替进行:(i) 在当前奖励下通过保守Q学习(CQL)学习保守Q函数,(ii) 更新奖励参数,以最大化专家动作的预期Q值,同时抑制对超出分布动作的过度泛化。可以将此过程视为软值匹配原则下的最大似然估计。我们提供理论保证,表明BiCQL-ML收敛到一种奖励函数,在此函数下,专家策略为软最优。经验上,我们在标准离线RL基准测试中表明,BiCQL-ML在奖励恢复和下游策略性能方面均优于现有离线IRL基线。
引用
@article{arxiv.2511.22210,
title = {BiCQL-ML: A Bi-Level Conservative Q-Learning Framework for Maximum Likelihood Inverse Reinforcement Learning},
author = {Junsung Park},
journal= {arXiv preprint arXiv:2511.22210},
year = {2025}
}
备注
8 pages, 3 figures