DuoRC:面向复杂语言理解的释义阅读理解
计算与语言
2018-10-11 v4
摘要
我们提出 DuoRC,一个新颖的阅读理解(RC)数据集,其激发了超越现有 RC 数据集所提供挑战的若干神经语言理解新方法挑战。DuoRC 包含 186,089 个唯一问答对,创建自 7680 对电影情节的集合,其中每对反映同一电影的两个版本——一个来自 Wikipedia,另一个来自 IMDb——由两位不同作者撰写。我们请众包工作者从其中一个情节版本创建问题,并请另一组工作者从另一版本抽取或合成答案。DuoRC 的这一独特特性——问题与答案由叙述同一底层故事之文档的不同版本创建——从设计上确保了从一个版本创建的问题与另一版本中含答案的片段之间词汇重叠极少。此外,由于两个版本具有不同层次的情节细节、叙述风格、词汇等,从第二版本回答问题需要更深的语言理解并融入外部背景知识。并且,源自电影情节的段落(有别于现有数据集中典型的描述性段落)所呈现的叙述风格,显示出需要对跨多句子的事件进行复杂推理。确实,我们观察到在 SQuAD 数据集上已达近人类表现的最优神经 RC 模型,即便结合传统 NLP 技术以应对 DuoRC 提出的挑战,也表现极差(DuoRC 上 F1 分数 37.42%,而 SQuAD 数据集上为 86%)。这开辟了若干有趣的研究路径,其中 DuoRC 可补充其他 RC 数据集以探索研究语言理解的新型神经方法。
引用
@article{arxiv.1804.07927,
title = {DuoRC: Towards Complex Language Understanding with Paraphrased Reading Comprehension},
author = {Amrita Saha and Rahul Aralikatte and Mitesh M. Khapra and Karthik Sankaranarayanan},
journal= {arXiv preprint arXiv:1804.07927},
year = {2018}
}
备注
Accepted in ACL 2018