在贝叶斯逆强化学习中遍历价值
机器学习
2024-07-16 v1
摘要
贝叶斯逆强化学习(IRL)的目标是使用来自专家演示的集合来恢复奖励函数的后验分布,专家演示是针对未知奖励函数进行优化的。得到的奖励后验随后可用于合成在相同或类似任务上表现良好的学习者策略。贝叶斯 IRL 的关键挑战在于在假设空间与似然值之间建立计算鸿沟,后者通常以 Q 值为形式定义:vanilla 贝叶斯 IRL 需要在算法的每个步骤中解决代价高昂的前向规划问题——从奖励到 Q 值——可能需要进行数千次。我们通过一种简单的变更来解决这一问题:我们可以专注于 primarily 在 Q 值空间中工作,因为从 Q 值到奖励的计算开销大大降低。这种计算方式的逆转使得计算梯度以高效采样使用 Hamiltonian Monte Carlo 成为可能。我们提出了 ValueWalk——一种基于此见解的新的马尔可夫链蒙特卡罗方法——并在几个任务上展示了其优势。
引用
@article{arxiv.2407.10971,
title = {Walking the Values in Bayesian Inverse Reinforcement Learning},
author = {Ondrej Bajgar and Alessandro Abate and Konstantinos Gatsis and Michael A. Osborne},
journal= {arXiv preprint arXiv:2407.10971},
year = {2024}
}
备注
Published at the 40th Conference on Uncertainty in Artificial Intelligence (UAI 2024)