一种用于基于模型的高维逆向强化学习的函数逼近方法
机器学习
2017-08-28 v1 机器人学
摘要
本工作处理高维状态空间中的逆向强化学习问题,该问题依赖于基于模型的高维强化学习问题的高效求解。为了解决计算代价高昂的强化学习问题,我们提出了一种函数逼近方法以确保 Bellman 最优性方程始终成立,然后基于观察到的人类行为估计一个函数,用于逆向强化学习问题。所提方法的时间复杂度与动作集的基数呈线性关系,因此能够高效处理高维甚至连续的状态空间。我们在一个模拟环境中测试了所提方法以展示其准确性,并在三个临床任务中展示了如何将其用于评估医生的熟练程度。
引用
@article{arxiv.1708.07738,
title = {A Function Approximation Method for Model-based High-Dimensional Inverse Reinforcement Learning},
author = {Kun Li and Joel W. Burdick},
journal= {arXiv preprint arXiv:1708.07738},
year = {2017}
}
备注
arXiv admin note: substantial text overlap with arXiv:1707.09394