模仿学习中的因果混淆
机器学习
2019-11-05 v2 机器学习
摘要
行为克隆通过训练判别模型在给定观测下预测专家动作,将策略学习简化为监督学习。此类判别模型是非因果的:训练过程未察觉专家与环境之间交互的因果结构。我们指出,由于模仿学习中的分布偏移,忽略因果性尤为有害。特别地,它导致了一种反直觉的“因果误识别”现象:获取更多信息可能导致更差的性能。我们研究了该问题是如何产生的,并提出了一种解决方案,通过有针对性的干预——环境交互或专家查询——来确定正确的因果模型,从而克服该问题。我们表明,因果误识别出现在多个基准控制领域以及真实驾驶场景中,并验证了我们的解决方案相对于 DAgger 及其他基线与消融实验的有效性。
引用
@article{arxiv.1905.11979,
title = {Causal Confusion in Imitation Learning},
author = {Pim de Haan and Dinesh Jayaraman and Sergey Levine},
journal= {arXiv preprint arXiv:1905.11979},
year = {2019}
}
备注
Published at NeurIPS 2019 9 pages, plus references and appendices