中文

QAmeleon:仅用 5 个示例的多语言问答

计算与语言 2023-08-08 v2

摘要

大规模高质量数据集的出现是近年来问答(QA)取得进展的主要驱动力之一。然而,此类标注数据集难以且昂贵地收集,且除英语外极少存在,致使 QA 技术无法惠及代表性不足的语言。构建大规模单语训练数据集的一种替代方案是在少样本学习设定下利用预训练语言模型(PLMs)。我们的方法 QAmeleon 使用 PLM 自动生成多语言数据并据此训练 QA 模型,从而避免了昂贵的标注。每种语言仅用五个示例对 PLM 进行提示调优以合成数据,其准确率优于基于翻译的基线,弥合了仅英语基线与在近 50,000 个人工标注样本上训练的全监督上界之间约 60% 的差距,并且在低资源设定下始终比直接在标注样本上微调 QA 模型带来显著改进。在 TyDiQA-GoldP 与 MLQA 基准上的实验表明,用于数据合成的少样本提示调优可跨语言扩展,是大规模标注的可行替代方案。

关键词

引用

@article{arxiv.2211.08264,
  title  = {QAmeleon: Multilingual QA with Only 5 Examples},
  author = {Priyanka Agrawal and Chris Alberti and Fantine Huot and Joshua Maynez and Ji Ma and Sebastian Ruder and Kuzman Ganchev and Dipanjan Das and Mirella Lapata},
  journal= {arXiv preprint arXiv:2211.08264},
  year   = {2023}
}

备注

To Appear at Transactions of Association for Computational Linguistics (TACL)