面向低随机性与多样化行为策略的离线强化学习通用灵活 $f$-divergence
机器学习
2026-02-12 v1 人工智能
摘要
离线强化学习算法旨在改进收集数据所产生的行为策略,同时约束所学习的策略位于数据支持集内。然而,实际离线数据集常包含样本稀缺或探索有限,以及来自多样化专业水平行为策略的数据。有限的探索会损害离线强化学习算法估计 \textit{Q} 或 \textit{V} 值的能力,而对多样化行为策略的约束又过于保守。此类数据集需要在强化学习目标与行为策略约束之间取得平衡。我们首先通过更一般的线性规划形式及其凸共轭,识别 -divergence 与 Bellman 残差优化约束之间的联系。随后,我们提出 -divergence 的通用灵活函数形式,以在基于离线训练数据集的算法学习目标上引入自适应约束。在 MuJoCo、Fetch 和 AdroitHand 环境上的实验结果表明,所提出的 LP 形式是正确的,且灵活 -divergence 在应用于兼容约束优化算法时,对于从困难数据集中学习的潜力得到验证。
引用
@article{arxiv.2602.11087,
title = {General Flexible $f$-divergence for Challenging Offline RL Datasets with Low Stochasticity and Diverse Behavior Policies},
author = {Jianxun Wang and Grant C. Forbes and Leonardo Villalobos-Arias and David L. Roberts},
journal= {arXiv preprint arXiv:2602.11087},
year = {2026}
}
备注
Extended version of the full paper with the appendix accepted at AAMAS 2026