中文

面向低随机性与多样化行为策略的离线强化学习通用灵活 $f$-divergence

机器学习 2026-02-12 v1 人工智能

摘要

离线强化学习算法旨在改进收集数据所产生的行为策略,同时约束所学习的策略位于数据支持集内。然而,实际离线数据集常包含样本稀缺或探索有限,以及来自多样化专业水平行为策略的数据。有限的探索会损害离线强化学习算法估计 \textit{Q} 或 \textit{V} 值的能力,而对多样化行为策略的约束又过于保守。此类数据集需要在强化学习目标与行为策略约束之间取得平衡。我们首先通过更一般的线性规划形式及其凸共轭,识别 ff-divergence 与 Bellman 残差优化约束之间的联系。随后,我们提出 ff-divergence 的通用灵活函数形式,以在基于离线训练数据集的算法学习目标上引入自适应约束。在 MuJoCo、Fetch 和 AdroitHand 环境上的实验结果表明,所提出的 LP 形式是正确的,且灵活 ff-divergence 在应用于兼容约束优化算法时,对于从困难数据集中学习的潜力得到验证。

关键词

引用

@article{arxiv.2602.11087,
  title  = {General Flexible $f$-divergence for Challenging Offline RL Datasets with Low Stochasticity and Diverse Behavior Policies},
  author = {Jianxun Wang and Grant C. Forbes and Leonardo Villalobos-Arias and David L. Roberts},
  journal= {arXiv preprint arXiv:2602.11087},
  year   = {2026}
}

备注

Extended version of the full paper with the appendix accepted at AAMAS 2026