基于射影准测地学规划的离线目标条件强化学习
机器学习
2026-02-02 v3
摘要
离线目标条件强化学习旨在训练智能体以到达指定目标,这些目标来自之前收集的轨迹。将其规模化以应用于长期程度任务仍具有挑战性,尤其是由于价值估计误差的叠加效应。原则性几何方法为解决这些问题提供了潜在方案。基于此洞察,我们引入射影准测地学规划(ProQ),这是一种组合框架,首先学习一种非对称距离,然后将其重新用于两重用途:一是作为驱动稀疏关键点均匀分布在学习到的潜在空间中的排斥能量;二是作为引导向近似子目标的结构性方向成本。具体而言,ProQ将这种几何方法与拉格朗日离群检测器相结合,以确保学习到的关键点保持在可到达区域内。通过统一度量学习、关键点覆盖和目标条件控制,我们的方法产生有意义的子目标,并在多样化的导航基准测试中稳健地驱动长程目标到达。
引用
@article{arxiv.2506.18847,
title = {Offline Goal-Conditioned Reinforcement Learning with Projective Quasimetric Planning},
author = {Anthony Kobanda and Waris Radji and Mathieu Petitbois and Odalric-Ambrym Maillard and Rémy Portelas},
journal= {arXiv preprint arXiv:2506.18847},
year = {2026}
}