中文

分布式逆强化学习

机器学习 2026-05-29 v4

摘要

我们提出了一种用于离线逆强化学习(IRL)的分布式框架,联合建模奖励函数的不确定性以及完整的回报分布。不同于传统IRL方法仅恢复确定性奖励估计或匹配仅期望回报的做法,本方法通过最小化一次序支配违反(first-order stochastic dominance, FSD),从而将失真风险度量(distortion risk measures, DRMs)集成到策略学习中,能够恢复奖励分布和分布感知策略。该表述特别适合行为分析和风险感知的仿真学习。理论分析表明,该算法在 O(ε2)\mathcal{O}(\varepsilon^{-2}) 的迭代复杂度下收敛。实验结果在合成基准、真实神经行为数据以及 MuJoCo 控制任务上表明,本方法能够恢复具有表达力的奖励表征并实现最先进的性能。

关键词

引用

@article{arxiv.2510.03013,
  title  = {Distributional Inverse Reinforcement Learning},
  author = {Feiyang Wu and Ye Zhao and Anqi Wu},
  journal= {arXiv preprint arXiv:2510.03013},
  year   = {2026}
}

备注

ICML 2026 Oral