基于可微语义建图与规划的自主导航逆强化学习
机器学习
2021-01-05 v1 机器人学
摘要
本文关注利用距离与语义类别观测进行自主导航的逆强化学习。目标是推断出一个代价函数,该函数能在仅依赖专家观测与状态-控制轨迹的条件下解释所演示的行为。我们开发了一个地图编码器,从观测序列推断语义类别概率,以及一个代价编码器,定义为基于语义特征的深度神经网络。由于专家代价不可直接观测,模型参数只能通过微分演示控制与基于代价估计计算出的控制策略之间的误差来优化。我们提出一种新的专家行为模型,可通过运动规划算法仅在一组有希望的状态上计算闭式子梯度来实现误差最小化。我们的方法可将学到的行为泛化到具有语义类别新空间配置的新环境。我们在 minigrid 环境中分析了模型各组件。我们还证明,在自主驾驶 CARLA 模拟器中,通过依赖对建筑、人行道和车道的语义观测,我们的方法学会了遵守交通规则。
引用
@article{arxiv.2101.00186,
title = {Inverse reinforcement learning for autonomous navigation via differentiable semantic mapping and planning},
author = {Tianyu Wang and Vikas Dhiman and Nikolay Atanasov},
journal= {arXiv preprint arXiv:2101.00186},
year = {2021}
}
备注
16 pages, 12 figures. arXiv admin note: text overlap with arXiv:2006.05043