中文

若能骗倒你:问答中人机协同生成的对抗样本

计算与语言 2019-07-17 v4

摘要

对抗性评估可压力测试模型对自然语言的理解能力。尽管已有方法揭示了表层模式,但其生成的对抗样本在复杂性与多样性上有限。我们提出人机协同对抗生成,引导人类作者去攻破模型。我们通过交互式用户界面提供对模型预测的解释以辅助作者。我们将该生成框架应用于名为Quizbowl的问答任务,由问答爱好者精心构造对抗性问题。所生成的问题通过实时人机对抗比赛进行验证:尽管这些问题对人类而言看似平常,却能系统性地难倒神经网络与信息检索模型。这些对抗问题涵盖从多跳推理到实体类型干扰项等多种现象,暴露了鲁棒问答中尚待解决的挑战。

关键词

引用

@article{arxiv.1809.02701,
  title  = {Trick Me If You Can: Human-in-the-loop Generation of Adversarial Examples for Question Answering},
  author = {Eric Wallace and Pedro Rodriguez and Shi Feng and Ikuya Yamada and Jordan Boyd-Graber},
  journal= {arXiv preprint arXiv:1809.02701},
  year   = {2019}
}

备注

Author final version of article accepted for publication in TACL 2019