用于离线目标条件强化学习的物理先验价值学习器
机器学习
2025-10-10 v3
摘要
离线目标条件强化学习(GCRL)在自主导航和运动控制等领域具有巨大潜力,因为在这些领域收集交互数据成本高昂且不安全。然而,由于需要从状态-动作空间覆盖有限的数据集中学习,并泛化到长视野任务,这在实践中仍然具有挑战性。为了改善这些挑战,我们提出了一种用于价值学习的物理先验正则化损失,它源自 Eikonal 偏微分方程(PDE),并在学习到的价值函数中引入了几何归纳偏置。与主要用于稳定训练的通用梯度惩罚不同,我们的公式以连续时间最优控制为基础,并鼓励价值函数与代价函数结构对齐。所提出的正则化器与基于时序差分的价值学习广泛兼容,可以集成到现有的离线 GCRL 算法中。当与分层隐式 Q-Learning(HIQL)结合时,所产生的方法 Eikonal 正则化 HIQL(Eik-HIQL)在性能和泛化方面均取得了显著提升,在拼接机制和大规模导航任务中增益尤为突出。
引用
@article{arxiv.2509.06782,
title = {Physics-informed Value Learner for Offline Goal-Conditioned Reinforcement Learning},
author = {Vittorio Giammarino and Ruiqi Ni and Ahmed H. Qureshi},
journal= {arXiv preprint arXiv:2509.06782},
year = {2025}
}