基于最优传输理论理解逆强化学习中的奖励歧义
机器学习
2023-10-19 v1 系统与控制
系统与控制
最优化与控制
摘要
在逆强化学习(IRL)中,核心目标是从观测到的专家行为中推断潜在的奖励函数,使其不仅能解释给定数据,还能泛化到未见过场景。这保证了对于奖励歧义的鲁棒性,即多个奖励函数可同等解释同一专家行为。尽管在解决该问题上已付出大量努力,现有方法常面临高维问题的挑战且缺乏几何基础。本文利用最优传输(OT)理论为这些挑战提供新视角。通过使用 OT 中的 Wasserstein 距离,我们建立了一个几何框架,可量化奖励歧义并识别奖励函数的中心表示或质心。这些见解为基于几何解释的鲁棒 IRL 方法铺平了道路,提供了在高维设定中处理奖励歧义的结构化方法。
引用
@article{arxiv.2310.12055,
title = {Understanding Reward Ambiguity Through Optimal Transport Theory in Inverse Reinforcement Learning},
author = {Ali Baheri},
journal= {arXiv preprint arXiv:2310.12055},
year = {2023}
}