击败 AI:面向阅读理解的对抗性人工标注研究
计算与语言
2020-11-18 v2
摘要
标注方法的创新一直是阅读理解(RC)数据集与模型的催化剂。近期一项挑战当前 RC 模型的趋势是在标注过程中引入模型:人类以对抗方式创建问题,使模型无法正确回答。在这项工作中,我们研究这种标注方法,并将其应用于三种不同设置,在标注循环中收集了总计 36,000 个样本,所用模型强度逐步增强。这使我们能够探究诸如对抗效应的可复现性、从具有不同模型在环强度的数据上的迁移,以及向无模型收集数据的泛化等问题。我们发现,在对抗收集的样本上训练可强泛化至非对抗收集的数据集,但随着模型在环强度递增,性能逐渐退化。此外,我们发现更强的模型仍可从由显著更弱模型在环收集的数据集中学习。当在带有 BiDAF 模型在环收集的数据上训练时,RoBERTa 在其于 SQuAD 上训练时无法回答的问题上达到 39.9F1——仅略低于使用 RoBERTa 自身在环收集数据训练时的 41.0F1。
引用
@article{arxiv.2002.00293,
title = {Beat the AI: Investigating Adversarial Human Annotation for Reading Comprehension},
author = {Max Bartolo and Alastair Roberts and Johannes Welbl and Sebastian Riedel and Pontus Stenetorp},
journal= {arXiv preprint arXiv:2002.00293},
year = {2020}
}