中文

基于跨语言稠密段落检索的单一多语言问答模型

计算与语言 2021-10-29 v2

摘要

我们提出跨语言开放检索答案生成(CORA),这是首个统一的多对多问答(QA)模型,能够跨多种语言回答问题,即便对于没有语言特定标注数据或知识源的语言也是如此。我们引入了一种新的稠密段落检索算法,经训练可为问题跨语言检索文档。结合多语言自回归生成模型,CORA 直接在目标语言中作答,无需像先前工作那样使用任何翻译或语言内检索模块。我们提出了一种迭代训练方法,可自动将仅存在于高资源语言中的标注数据扩展到低资源语言。我们的结果表明,CORA 在涵盖 26 种语言的跨语言开放 QA 基准上大幅优于先前的 state-of-the-art,其中 9 种语言在训练中未出现。我们的分析显示了跨语言检索与生成在多种语言中的重要性,尤其是在低资源设定下。

关键词

引用

@article{arxiv.2107.11976,
  title  = {One Question Answering Model for Many Languages with Cross-lingual Dense Passage Retrieval},
  author = {Akari Asai and Xinyan Yu and Jungo Kasai and Hannaneh Hajishirzi},
  journal= {arXiv preprint arXiv:2107.11976},
  year   = {2021}
}

备注

Published as a conference paper at NeurIPS 2021. Our code and trained model are publicly available at https://github.com/AkariAsai/CORA