中文

基于归一化流的数据高效层次化目标条件强化学习

机器人学 2026-02-12 v1 人工智能 机器学习

摘要

层次化目标条件强化学习(H-GCRL)提供了一种解决复杂、持久任务的强大框架,通过将其分解为结构化子目标来实现。然而,其实际应用受限于数据效率差和策略表达性有限,尤其是在离线或数据稀缺的情境下。在本工作中,引入了基于归一化流的层次化隐式Q学习(NF-HIQL),一种新型框架,用以替换高层和低层的单模高斯政策为具有表现力的归一化流政策。该设计使可计算的对数似然性计算、有效抽样以及能够建模丰富多模态行为的能力成为可能。推导了新的理论保证,包括针对Real-valued non-volume preserving(RealNVP)政策的显式KL散度界限以及PAC风格的样本效率结果,表明NF-HIQL在保持稳定性的同时提高了泛化能力。经验上,在从OGBench进行的 locomotion、球踢球和多步骤操作等多样化长期任务上的评估表明,NF-HIQL consistently优于先前的目标条件和层次化基线,在有限数据下的鲁棒性更好,凸显了基于流的架构在可扩展、数据高效的层次化强化学习中的潜力。

关键词

引用

@article{arxiv.2602.11142,
  title  = {Data-Efficient Hierarchical Goal-Conditioned Reinforcement Learning via Normalizing Flows},
  author = {Shaswat Garg and Matin Moezzi and Brandon Da Silva},
  journal= {arXiv preprint arXiv:2602.11142},
  year   = {2026}
}

备注

9 pages, 3 figures, IEEE International Conference on Robotics and Automation 2026