中文

基于Malliavin Calculus的自适应逆向强化学习中的反事实梯度估计

机器学习 2026-05-07 v2

摘要

逆向强化学习(IRL)从观察到的响应中恢复前向学习者的损失函数。自适应IRL旨在通过被动观察学习者在强化学习(RL)中执行的梯度来重建前向学习者的损失函数。本文提出一种新型的被动Langevin-based算法,实现自适应IRL。自适应IRL的关键难点在于,被动算法中所需的梯度是反事实的,即它们在前向学习者轨迹下的概率为零的事件上进行条件化。因此,朴素的蒙特卡洛估计器效率极低,核平滑虽常见,但收敛速度较慢。我们通过采用Malliavin calculus高效估计所需的反事实梯度来克服这一难题。我们将反事实条件化表述为未条件期望中Malliavin量之比,从而恢复标准估计速率。我们推导了通用Langevin结构下必需的Malliavin导数及其 adjoint Skorohod积分公式,提供了具体的算法方法,利用这些方法实现反事实梯度估计。

关键词

引用

@article{arxiv.2604.01345,
  title  = {Malliavin Calculus for Counterfactual Gradient Estimation in Adaptive Inverse Reinforcement Learning},
  author = {Vikram Krishnamurthy and Luke Snow},
  journal= {arXiv preprint arXiv:2604.01345},
  year   = {2026}
}