中文

WANLI:面向自然语言推理数据集构建的众包工人与 AI 协作方法

计算与语言 2022-11-16 v5

摘要

大规模众包 NLP 数据集的一个反复出现的挑战是,人类标注者在编写样例时常常依赖重复模式,导致语言多样性不足。我们提出了一种基于工人与 AI 协作的新颖数据集构建方法,该方法将语言模型的生成优势与人类的评估优势结合起来。从现有的自然语言推理(NLI)数据集 MultiNLI 出发,我们的方法利用数据集制图(dataset cartography)自动识别展现出具有挑战性推理模式的样例,并指导 GPT-3 生成具有相似模式的新样例。机器生成的样例随后被自动过滤,最后由众包工人修订并标注。所得数据集 WANLI 包含 107,885 个 NLI 样例,相较于现有 NLI 数据集展现出独特的实证优势。值得注意的是,在我们考虑的八个域外测试集上,使用 WANLI 训练模型相较于使用规模大 4 倍的 MultiNLI 训练,性能有所提升,包括在 HANS 上提升 11%、在 Adversarial NLI 上提升 9%。此外,它持续比用其他 NLI 数据集增强的 MultiNLI 更有效。我们的结果展示了利用自然语言生成技术并重新构想人类在数据集创建过程中的角色的前景。

关键词

引用

@article{arxiv.2201.05955,
  title  = {WANLI: Worker and AI Collaboration for Natural Language Inference Dataset Creation},
  author = {Alisa Liu and Swabha Swayamdipta and Noah A. Smith and Yejin Choi},
  journal= {arXiv preprint arXiv:2201.05955},
  year   = {2022}
}

备注

EMNLP Findings camera-ready