中文

MuCoT:面向低资源语言问答的多语言对比训练

计算与语言 2022-04-13 v1 人工智能 机器学习

摘要

近年来,随着基于Transformer的模型(如BERT)的出现,英语问答(QA)系统的准确率显著提升。这些模型以自监督方式使用大型英语文本语料库进行预训练,并使用海量英语QA数据集(如SQuAD)进一步微调。然而,大多数其他语言并不具备如此规模的QA数据集。多语言基于BERT的模型(mBERT)常被用于从高资源语言向低资源语言迁移知识。由于这些模型使用包含多种语言的海量文本语料库进行预训练,它们通常为来自不同语言的词元学习语言无关的嵌入。然而,由于训练数据的匮乏,直接训练基于mBERT的低资源语言QA系统具有挑战性。在这项工作中,我们通过将目标语言的QA样本翻译和转写为其他语言来进行扩充,并使用扩充后的数据微调一个已在英语上预训练的基于mBERT的QA模型。在Google ChAII数据集上的实验表明,使用同一语系的翻译微调mBERT模型可提升问答性能,而在跨语系情况下性能会下降。我们进一步表明,在微调过程中引入翻译后的问题-上下文特征对之间的对比损失,可防止跨语系翻译导致的此类性能下降,并带来轻微提升。本工作的代码可在 https://github.com/gokulkarthik/mucot 获取。

关键词

引用

@article{arxiv.2204.05814,
  title  = {MuCoT: Multilingual Contrastive Training for Question-Answering in Low-resource Languages},
  author = {Gokul Karthik Kumar and Abhishek Singh Gehlot and Sahal Shaji Mullappilly and Karthik Nandakumar},
  journal= {arXiv preprint arXiv:2204.05814},
  year   = {2022}
}

备注

Accepted for oral presentation at ACL 2022 Workshop on Speech and Language Technologies for Dravidian Languages