看这个:城市环境中路径规划的可扩展代价函数学习
机器人学
2016-07-11 v1 机器学习
摘要
在这项工作中,我们提出了一种从大量人类专家驾驶行为演示中学习复杂城市环境驾驶代价图的方法。学习到的代价图直接从原始传感器测量构建,省去了手动设计代价图和特征的精力。在部署学习到的代价图时,生成的轨迹不仅复制了类人驾驶行为,而且对假设机器人配置中的系统性误差表现出明显的鲁棒性。为实现这一点,我们部署了一个基于最大熵的非线性 IRL 框架,该框架使用全卷积神经网络(FCN)来表示专家驾驶行为背后的代价模型。使用深度参数化方法使我们能够高效扩展到大型数据集和复杂行为,因为在部署期间其运行时间与数据集规模无关。我们在一个历时一年收集的雄心勃勃的数据集上展示了所提方法的可扩展性和性能,该数据集包含从英国 Milton Keynes 市行人区周围超过 120 公里的驾驶中提取的超过 25k 条演示轨迹。我们通过展示相对于精心手动设计的代价图的优势来评估所得的代价表示,此外,还通过在存在系统校准扰动的情况下学习精确的代价图来证明其对系统性误差的鲁棒性。
引用
@article{arxiv.1607.02329,
title = {Watch This: Scalable Cost-Function Learning for Path Planning in Urban Environments},
author = {Markus Wulfmeier and Dominic Zeng Wang and Ingmar Posner},
journal= {arXiv preprint arXiv:1607.02329},
year = {2016}
}
备注
Accepted for publication in the Proceedings of the 2016 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2016)