将人类领域知识融入大规模代价函数学习
机器人学
2016-12-14 v1 人工智能
机器学习
摘要
近期进展表明,全卷积神经网络(FCN)能够在仅基于人类驾驶员演示数据学习驾驶偏好的背景下,为运动规划建模代价函数。虽然基于逆强化学习(IRL)框架的纯演示学习是一种有前景的方法,但我们可以从信息丰富的人类先验中获益,并将其融入学习过程。我们的工作通过对模型进行预训练以回归到人工设计的代价函数,并基于最大熵深度逆强化学习对其进行精炼来实现这一点。当将先验知识作为网络的预训练注入时,我们获得了更高的鲁棒性、视觉上更清晰的障碍物边界,以及捕捉那些纯从演示数据学习的模型所遗漏的障碍物实例的能力。此外,通过利用这些人类先验,所得模型能更准确地处理演示数据中罕见的极端情况,如楼梯、斜坡和地下通道。
引用
@article{arxiv.1612.04318,
title = {Incorporating Human Domain Knowledge into Large Scale Cost Function Learning},
author = {Markus Wulfmeier and Dushyant Rao and Ingmar Posner},
journal= {arXiv preprint arXiv:1612.04318},
year = {2016}
}
备注
Neural Information Processing Systems 2016, Deep Reinforcement Learning Workshop