中文

X-PARADE:跨语言段落级文本蕴含与信息分歧

计算与语言 2024-04-17 v2

摘要

理解两段文本何时传达相同信息,是触及自然语言处理中许多子问题的目标,包括文本蕴含与事实核查。当这两段文本使用不同语言时,该问题变得更加复杂。在此,我们介绍 X-PARADE(跨语言段落级分歧与蕴含分析),这是首个跨语言段落级信息分歧数据集。标注者在目标语言段落中以片段级别进行标注,并相对于源语言中的对应段落进行评估,指明给定信息是相同的、新的,还是新的但可推断的。最后一种概念建立了与跨语言自然语言推理(NLI)的联系。对齐段落取自不同语言的维基百科页面,反映了真实场景中观察到的信息分歧。借助我们的数据集,我们研究了解决该问题的多种方法,包括来自机器翻译的 token 对齐、能够定位其决策的文本蕴含方法,以及提示 LLM。我们的结果表明,这些方法在处理可推断信息的能力上各有不同,但都远未达到人类水平。

关键词

引用

@article{arxiv.2309.08873,
  title  = {X-PARADE: Cross-Lingual Textual Entailment and Information Divergence across Paragraphs},
  author = {Juan Diego Rodriguez and Katrin Erk and Greg Durrett},
  journal= {arXiv preprint arXiv:2309.08873},
  year   = {2024}
}

备注

To be published in NAACL 2024