在部分可观测环境中从示范学习导航代价
机器学习
2020-02-27 v1 机器人学
机器学习
摘要
本文关注逆强化学习(IRL),以实现在未知部分可观测环境中的安全高效自主导航。目标是推断一个代价函数,在仅依赖专家所使用的观测与状态-控制轨迹的情况下,解释专家示范的导航行为。我们开发了一种由两部分组成的代价函数表示:一个对观测序列具有循环依赖的概率占据编码器,以及一个定义于占据特征之上的代价编码器。该表示参数通过对示范控制与由代价编码器计算出的控制策略之间的误差求导来进行优化。此类求导通常通过值函数在整个状态空间上的动态规划计算。我们观察到,在大型部分可观测环境中这是低效的,因为大多数状态未被探索。相反,我们依赖于仅通过高效运动规划算法(如 A* 或 RRT)在一组有希望的状态上获得的代价到目标的闭式子梯度。我们的实验表明,我们的模型在机器人导航任务中超越了基线 IRL 算法的精度,同时大幅提升了训练与测试时推理的效率。
引用
@article{arxiv.2002.11637,
title = {Learning Navigation Costs from Demonstration in Partially Observable Environments},
author = {Tianyu Wang and Vikas Dhiman and Nikolay Atanasov},
journal= {arXiv preprint arXiv:2002.11637},
year = {2020}
}
备注
6 pages, 5 figures