中文

用于离线强化学习的熵正则化伴随匹配

机器学习 2026-05-11 v2 人工智能

摘要

将富有表达力的生成式策略(如流匹配模型)集成到离线强化学习(RL)中,使智能体能够捕捉复杂的多模态行为。虽然带有伴随匹配的 Q-learning(QAM)通过连续伴随方法稳定了策略优化,但它本质上仍受限于固定的行为分布。这种依赖性引发了流行度偏差,可能抑制低密度区域中的高奖励动作,并产生支持绑定,限制了离流形探索。现有的变通方法,如附加残差高斯策略,通常会重新引入与单峰分布相关的表达力瓶颈。在这项工作中,我们提出了最大熵伴随匹配(ME-AM),这是一个在连续流公式中解决这些局限性的统一框架。ME-AM 包含两个机制:(1) 镜像下降熵最大化目标,用于缓解流行度偏差,从而促进从离线数据集中提取最优策略;(2) 混合行为先验,用于拓宽几何支持,以涵盖分布外的高奖励区域。通过探索这种扩展的几何结构,ME-AM 在保持生成向量场绝对连续性的同时,识别出鲁棒的动作。从经验上看,在一系列稀疏奖励连续控制环境中,ME-AM 与先前最先进的 SOTA 方法相比,表现出具有竞争力或更优的性能。

关键词

引用

@article{arxiv.2605.06156,
  title  = {Entropy-Regularized Adjoint Matching for Offline Reinforcement Learning},
  author = {Abdelghani Ghanem and Mounir Ghogho},
  journal= {arXiv preprint arXiv:2605.06156},
  year   = {2026}
}