中文

基于最优传输理论理解逆强化学习中的奖励歧义

机器学习 2023-10-19 v1 系统与控制 系统与控制 最优化与控制

摘要

在逆强化学习(IRL)中,核心目标是从观测到的专家行为中推断潜在的奖励函数,使其不仅能解释给定数据,还能泛化到未见过场景。这保证了对于奖励歧义的鲁棒性,即多个奖励函数可同等解释同一专家行为。尽管在解决该问题上已付出大量努力,现有方法常面临高维问题的挑战且缺乏几何基础。本文利用最优传输(OT)理论为这些挑战提供新视角。通过使用 OT 中的 Wasserstein 距离,我们建立了一个几何框架,可量化奖励歧义并识别奖励函数的中心表示或质心。这些见解为基于几何解释的鲁棒 IRL 方法铺平了道路,提供了在高维设定中处理奖励歧义的结构化方法。

关键词

引用

@article{arxiv.2310.12055,
  title  = {Understanding Reward Ambiguity Through Optimal Transport Theory in Inverse Reinforcement Learning},
  author = {Ali Baheri},
  journal= {arXiv preprint arXiv:2310.12055},
  year   = {2023}
}