中文

解决新兴领域开放检索问答系统中的跨语言问题

计算与语言 2022-01-28 v1 信息检索

摘要

开放检索问答系统通常在成熟领域的大型数据集上训练和测试。然而,低资源环境(如新的和新兴领域)尤其受益于可靠的问答系统。此外,新兴领域中的多语言和跨语言资源稀缺,导致此类系统很少或没有。在本文中,我们展示了一个面向COVID-19新兴领域的跨语言开放检索问答系统。我们的系统采用科学文献语料库以确保检索到的文档可靠。为解决新兴领域中跨语言训练数据的稀缺性,我们提出了一种利用自动翻译、对齐和过滤来生成英语到所有语言数据集的方法。我们表明深度语义检索器从在我们的英语到所有语言数据上训练中极大受益,并在跨语言设定下显著优于BM25基线。我们用示例说明了系统的能力,并发布了训练和部署此类系统所需的所有代码。

关键词

引用

@article{arxiv.2201.11153,
  title  = {Addressing Issues of Cross-Linguality in Open-Retrieval Question Answering Systems For Emergent Domains},
  author = {Alon Albalak and Sharon Levy and William Yang Wang},
  journal= {arXiv preprint arXiv:2201.11153},
  year   = {2022}
}

备注

6 pages, 8 figures