中文

跨语言问答中归因的评估与建模

计算与语言 2023-11-16 v2

摘要

可信的答案内容在许多高资源语言中十分丰富,并可通过问答系统即时获取,但对于不说这些语言的人而言,这些内容可能难以访问。生成式语言模型在跨语言建模质量上的飞跃带来了诸多前景,但其原始生成内容常在事实性上有所欠缺。为提升这些系统的可信度,一个有前景的方向是将答案归因于检索到的来源,该来源可能使用与查询不同的内容丰富的语言。我们的工作是首个研究跨语言问答中归因的工作。首先,我们收集了5种语言的数据来评估最先进的跨语言QA系统的归因水平。令我们惊讶的是,我们发现尽管系统能够直接关注检索到的文本,仍有相当大一部分答案无法归因于任何检索段落(在与黄金参考完全匹配的答案中高达50%)。其次,为解决这一较差的归因水平,我们尝试了广泛的归因检测技术。我们发现自然语言推理模型以及在极少量归因数据上微调的PaLM 2能够准确检测归因。基于这些模型,我们提升了跨语言问答系统的归因水平。总体而言,我们表明当前的学术生成式跨语言QA系统在归因方面存在显著缺陷,并构建了缓解这些问题的工具。

关键词

引用

@article{arxiv.2305.14332,
  title  = {Evaluating and Modeling Attribution for Cross-Lingual Question Answering},
  author = {Benjamin Muller and John Wieting and Jonathan H. Clark and Tom Kwiatkowski and Sebastian Ruder and Livio Baldini Soares and Roee Aharoni and Jonathan Herzig and Xinyi Wang},
  journal= {arXiv preprint arXiv:2305.14332},
  year   = {2023}
}

备注

Published as a long paper at EMNLP 2023