FP-IRL:Fokker--Planck 逆强化学习——一种面向马尔可夫决策过程的物理约束方法
机器学习
2026-05-01 v3 人工智能
生物物理
细胞行为
摘要
逆强化学习(IRL)是一种通过从马尔可夫决策过程(MDP)中观测到的轨迹推断未知奖励函数,从而揭示驱动智能体行为的激励结构的强大范式。然而,大多数现有 IRL 方法需要访问转移函数,无论是预先给定还是估计,当底层动力学未知、不可观测或不易采样时,这带来了重大挑战。我们提出 Fokker--Planck 逆强化学习(FP-IRL),一种专为可用 Fokker--Planck(FP)动力学描述的系统量身定制的新型物理约束 IRL 框架。FP-IRL 直接从轨迹数据同时推断奖励函数和转移函数,无需访问采样转移。我们的方法利用 MDP 与 FP 方程之间的对应关系,将 MDP 中的奖励最大化与 FP 动力学中的自由能最小化相联系。该联系使得可使用我们的变分系统辨识推断方法推断 FP 势函数,并由此利用解析表达式恢复完整的 MDP 组件——奖励、转移和策略。我们通过在合成基准和修改后的 Mountain Car 问题上的实验证明了 FP-IRL 的有效性。我们的结果表明,FP-IRL 在保持计算效率和物理可解释性的同时,实现了对智能体激励的准确恢复。
引用
@article{arxiv.2306.10407,
title = {FP-IRL: Fokker--Planck Inverse Reinforcement Learning -- A Physics-Constrained Approach to Markov Decision Processes},
author = {Chengyang Huang and Siddhartha Srivastava and Kenneth K. Y. Ho and Kathy E. Luker and Gary D. Luker and Xun Huan and Krishna Garikipati},
journal= {arXiv preprint arXiv:2306.10407},
year = {2026}
}