中文

ReNeg与Backseat Driver:基于连续人类反馈的示范学习

机器学习 2019-01-17 v1 人工智能 机器人学 机器学习

摘要

在自动驾驶车辆(AV)控制中,允许犯错在现实世界中可能非常危险且代价高昂。为此,我们研究在不让智能体探索、而由人类探索者收集数据的情形下训练AV的方法。监督学习已被用于AV控制,但面临协变量偏移问题。即,由最优示范收集的训练数据仅包含最优控制策略所诱导的状态,而在运行时,训练后的智能体可能遇到状态分布差异巨大且缺乏相关训练数据的状态。为缓解该问题,我们让人类探索者做出次优决策。为使智能体不复制这些次优决策,监督学习要求我们要么擦除这些动作,要么以正确动作替换之。擦除造成浪费,而替换颇为困难,因为在不驾驶的情况下不易知晓正确动作。我们提出一种替代框架,包含针对每个动作的连续标量反馈,标记哪些动作应复制、哪些应避免以及确信程度。我们的框架从训练前收集的次优示范与评价反馈中学习连续控制。我们发现人类示范者可以安全方式探索次优状态,同时仍获得足够梯度以利于学习。这种数据与反馈的收集方法称为“Backseat Driver”。我们将更通用的学习框架称为ReNeg,因其给定负例与正例从状态回归动作。我们在ReNeg框架下对若干模型进行实证验证,在有限数据下的车道跟随任务上测试。我们发现最佳解为准均方误差的推广,且在仅正例上优于监督学习。

关键词

引用

@article{arxiv.1901.05101,
  title  = {ReNeg and Backseat Driver: Learning from Demonstration with Continuous Human Feedback},
  author = {Jacob Beck and Zoe Papakipos and Michael Littman},
  journal= {arXiv preprint arXiv:1901.05101},
  year   = {2019}
}