SQuAD数据集的西班牙语自动翻译用于多语言问答
计算与语言
2019-12-13 v2
摘要
近年来,多语言问答已成为关键研究课题,并受到NLP社区日益增长的关注。然而,大规模数据集的缺失使得训练性能可与英语系统媲美的多语言QA系统颇具挑战。本工作中,我们提出翻译对齐检索(TAR)方法,将斯坦福问答数据集(SQuAD)v1.1自动翻译为西班牙语。随后我们使用该数据集通过微调Multilingual-BERT模型来训练西班牙语QA系统。最后,我们利用近期提出的MLQA和XQuAD基准对跨语言抽取式QA评测了我们的QA模型。实验结果表明,我们的模型超越了此前的Multilingual-BERT基线,在西班牙语MLQA语料上取得68.1 F1点的新最优值,在西班牙语XQuAD语料上取得77.6 F1和61.8精确匹配点。所生成的、合成得到的SQuAD-es v1.1语料库包含原英文版本近100%的数据,据我们所知,这是首个面向西班牙语的大规模QA训练资源。
引用
@article{arxiv.1912.05200,
title = {Automatic Spanish Translation of the SQuAD Dataset for Multilingual Question Answering},
author = {Casimiro Pio Carrino and Marta R. Costa-jussà and José A. R. Fonollosa},
journal= {arXiv preprint arXiv:1912.05200},
year = {2019}
}
备注
Submitted to LREC 2020