对抗模仿学习中抑制假阴性
机器学习
2020-02-04 v1 人工智能
机器学习
摘要
在对抗模仿学习中,训练一个判别器以区分智能体轨迹与代表期望行为的专家演示。然而,随着训练策略愈发成功,负样本(由智能体产生)变得与专家样本越来越相似。尽管智能体的某些轨迹已成功完成任务,判别器仍被训练为对它们输出低值。我们假设这种对判别器不一致的训练信号会阻碍其学习,进而导致智能体整体性能变差。我们给出了支持该假设的实验证据,并表明“假阴性”(即成功的智能体轨迹)显著阻碍对抗模仿学习,这是本文的第一项贡献。随后,我们提出一种缓解假阴性影响的方法,并在 BabyAI 环境中进行了测试。该方法相较基线始终将样本效率提升至少一个数量级。
引用
@article{arxiv.2002.00412,
title = {Combating False Negatives in Adversarial Imitation Learning},
author = {Konrad Zolna and Chitwan Saharia and Leonard Boussioux and David Yu-Tung Hui and Maxime Chevalier-Boisvert and Dzmitry Bahdanau and Yoshua Bengio},
journal= {arXiv preprint arXiv:2002.00412},
year = {2020}
}
备注
This is an extended version of the student abstract published at 34th AAAI Conference on Artificial Intelligence