利用大规模合成监督预训练跨语言开放域问答
计算与语言
2024-10-03 v3 信息检索
摘要
跨语言开放域问答(CLQA)是一个复杂的问题,包括从多语言知识库中进行跨语言检索,然后以查询语言生成答案。这两个步骤通常由独立的模型处理,需要大量的标注数据集和典型的辅助资源,如用于语言间桥接的机器翻译系统。在本文中,我们展示了可以使用单个编码器-解码器模型来解决CLQA。为了有效训练该模型,我们提出了一种基于利用维基百科内跨语言链接结构的自监督方法。我们演示了如何利用链接的维基百科页面,通过一种完形查询形式,为跨语言检索合成监督信号,并生成更自然的问题来监督答案生成。综合来看,我们的方法\texttt{CLASS}在监督和零样本语言自适应设置中均优于同类方法,包括那些使用机器翻译的方法。
引用
@article{arxiv.2402.16508,
title = {Pre-training Cross-lingual Open Domain Question Answering with Large-scale Synthetic Supervision},
author = {Fan Jiang and Tom Drummond and Trevor Cohn},
journal= {arXiv preprint arXiv:2402.16508},
year = {2024}
}
备注
EMNLP 2024 Main