中文

ZusammenQA:面向跨语言开放检索问答系统的基于专用模型的数据增强

计算与语言 2022-05-31 v1

摘要

本文介绍我们为 MIA 跨语言开放检索问答(COQA)共享任务所提出的系统。在这一极具挑战性的场景中,给定输入问题,系统须从多语言文档池中收集证据文档,并据此以问题所属语言生成答案。我们设计了多种方法,组合不同模型变体以构建三个主要组件:数据增强、段落检索与答案生成。对于段落检索,我们评估了单语 BM25 排序器与基于多语言预训练语言模型(PLM)的重排序器集成,以及共享任务基线的若干变体,并使用近期提出的对比损失从头重训练基线,该损失借助混合负样本在全程训练中保持强梯度信号。对于答案生成,我们通过既有多语言编码器的持续语言模型(LM)预训练,聚焦于语言与领域专门化。此外,对于段落检索与答案生成,我们利用自动从维基百科段落生成的问答对增强了任务组织方提供的训练数据,以缓解数据稀缺问题,尤其针对未提供训练数据的低资源语言。我们的结果表明,语言与领域专门化以及数据增强均有助益,特别是对低资源语言。

关键词

引用

@article{arxiv.2205.14981,
  title  = {ZusammenQA: Data Augmentation with Specialized Models for Cross-lingual Open-retrieval Question Answering System},
  author = {Chia-Chien Hung and Tommaso Green and Robert Litschko and Tornike Tsereteli and Sotaro Takeshita and Marco Bombieri and Goran Glavaš and Simone Paolo Ponzetto},
  journal= {arXiv preprint arXiv:2205.14981},
  year   = {2022}
}