可扩展贝叶斯逆强化学习
机器学习
2021-03-15 v2
摘要
对奖励进行贝叶斯推断为逆强化学习问题的病态性提供了理想解决方案。遗憾的是,由于需要内层 MDP 求解器,当前方法通常无法很好地扩展到小型表格设定之外;即便是那些自身可扩展的非贝叶斯方法,也常常需要与环境进行大量交互才能表现良好,因而不适用于医疗等高风险或高成本应用。本文提出我们的方法——近似变分奖励模仿学习(AVRIL),它通过变分方法联合学习可扩展到任意复杂状态空间的奖励近似后验分布,以及相应的策略,且完全以离线方式完成。我们将该方法应用于真实医疗数据和经典控制仿真,展示了在当前方法范围之外的环境中的贝叶斯奖励推断,以及可与专注的离线模仿学习算法相竞争的任务性能。
引用
@article{arxiv.2102.06483,
title = {Scalable Bayesian Inverse Reinforcement Learning},
author = {Alex J. Chan and Mihaela van der Schaar},
journal= {arXiv preprint arXiv:2102.06483},
year = {2021}
}