中文

面向离线目标条件强化学习的高效层次隐式流 Q 学习

机器学习 2026-04-13 v1

摘要

离线目标条件强化学习 (GCRL) 是一种旨在从无奖励离线数据中学习目标条件策略的实用强化学习范式。尽管近期在层次结构方面取得了如 HIQL 等进展,但在离线 GCRL 中长期控制仍面临高斯策略表达能力有限以及高层策略难以生成有效子目标的挑战。为此,我们提出了目标条件均值流策略,该方法在离线 GCRL 中引入平均速度场,以实现层次策略建模。具体而言,均值流策略通过学习的平均速度场捕捉高层和低层策略的复杂目标分布,实现通过单步抽样的高效动作生成。进一步考虑到目标表征的不足,我们引入 LeJEPA loss,通过迫使目标表征嵌入在训练期间相互排斥,从而鼓励更具辨识度的表征并提高泛化能力。实验结果表明,我们的方法在 OGBench 基准的基于状态和基于像素的任务上均取得了强劲性能。

关键词

引用

@article{arxiv.2604.08960,
  title  = {Efficient Hierarchical Implicit Flow Q-learning for Offline Goal-conditioned Reinforcement Learning},
  author = {Zhiqiang Dong and Teng Pang and Rongjian Xu and Guoqiang Wu},
  journal= {arXiv preprint arXiv:2604.08960},
  year   = {2026}
}