中文

基于粘性解的物理信息黏性价值表示

机器学习 2026-02-27 v1 机器人学

摘要

离线目标条件强化学习 (GCRL) 从静态预收集的数据集中学习目标条件策略,但由于状态-动作空间覆盖有限,准确的价值估计仍然是一个挑战。最近的物理信息方法通过在价值函数上施加物理和几何约束(如 Eikonal 方程)的正则化来解决此问题,但这些公式在复杂的高维环境中常常不适用。本文提出一种基于 Hamilton-Jacobi-Bellman (HJB) 方程粘性解的物理信息正则化。通过提供基于物理的归纳偏置,我们的方法将学习过程置于最优控制理论框架中,显式地对价值迭代中的更新进行正则化和界限化。进一步,我们利用 Feynman-Kac 定理将 PDE 解重新表述为期望,从而实现可计算的蒙特卡洛目标估计,避免了高阶梯度的数值不稳定性。实验表明,我们的方法改进了几何一致性,适用于导航和高维复杂操作任务。开源代码已发布于 https://github.com/HrishikeshVish/phys-fk-value-GCRL。

关键词

引用

@article{arxiv.2602.23280,
  title  = {Physics Informed Viscous Value Representations},
  author = {Hrishikesh Viswanath and Juanwu Lu and S. Talha Bukhari and Damon Conover and Ziran Wang and Aniket Bera},
  journal= {arXiv preprint arXiv:2602.23280},
  year   = {2026}
}