中文

从具语义观测的示范中学习导航代价

机器学习 2020-06-12 v2 机器人学 机器学习

摘要

本文关注利用语义观测进行自主机器人导航的逆强化学习(IRL)。目标是推断一个代价函数,在仅依赖专家观测与状态-控制轨迹的条件下解释示范行为。我们开发了地图编码器(从观测序列推断语义类概率)与代价编码器(定义为基于语义特征的深度神经网络)。由于专家代价不可直接观测,表示参数只能通过微分示范控制与基于代价估计计算的控制策略间误差来优化。该误差使用经运动规划算法仅在部分有希望状态上计算的闭式子梯度优化。我们展示该方法在自动驾驶CARLA模拟器中仅凭对车辆、人行道与车道的语义观测即学会遵守交通规则。

关键词

引用

@article{arxiv.2006.05043,
  title  = {Learning Navigation Costs from Demonstration with Semantic Observations},
  author = {Tianyu Wang and Vikas Dhiman and Nikolay Atanasov},
  journal= {arXiv preprint arXiv:2006.05043},
  year   = {2020}
}

备注

Conference on Learning for Dynamics and Control (L4DC 2020). arXiv admin note: text overlap with arXiv:2002.11637