M2QA:多域多语言问答
计算与语言
2024-07-02 v1
摘要
机器学习研究的核心期望之一是对输入变化的泛化和鲁棒性。语言沿多个维度变化,最重要的是语言实例(如法语)和领域(如新闻)。虽然对单一领域内的新语言或单一语言内的新领域进行 NLP 模型适应的研究广泛开展,但在联合适应方面的研究受限于缺乏评估数据集。这阻碍了将 NLP 系统从资源丰富的语言和领域转移到非主导语言-领域组合。为填补这一空白,我们引入 M2QA,这是一个多域多语言问答基准。M2QA 包含 13,500 份类似 SQuAD 2.0 的问答实例,涵盖德语、土耳其语和中文,以及产品评论、新闻和创意写作三个领域。我们使用 M2QA 探索了微调模型和最新大语言模型 (LLM) 的跨语言跨域性能,并研究了模块化的领域和语言适应方法。我们观察到 1) 同一模型类别内不同领域-语言组合表现出显著差异,以及 2) 在所有模型规模下,源语言-领域与目标语言-领域之间表现均出现显著下降。我们证明 M2QA 仍未被解决,新的方法对于有效传输语言和领域特定信息至关重要。我们将 M2QA 公开于 https://github.com/UKPLab/m2qa。
引用
@article{arxiv.2407.01091,
title = {M2QA: Multi-domain Multilingual Question Answering},
author = {Leon Engländer and Hannah Sterz and Clifton Poth and Jonas Pfeiffer and Ilia Kuznetsov and Iryna Gurevych},
journal= {arXiv preprint arXiv:2407.01091},
year = {2024}
}