从5个示例进行少样本多语言开放域问答
计算与语言
2025-02-28 v1 信息检索
摘要
近期多语言开放域问答(MLODQA)方法在拥有丰富语言特定训练数据的情况下已取得有前景的结果。然而,庞大的标注成本限制了这些方法在低资源语言中的应用。我们提出一种基于大语言模型(LLM)的少样本学习方法,用于合成大规模多语言数据。该方法首先利用WikiData进行大规模自监督预训练,随后通过少样本监督提示LLM生成高质量合成多语言数据进行训练。最终模型FsModQA在MLODQA以及跨语言和单语言检索任务上显著优于现有少样本和监督基线方法。我们进一步证明该方法可通过跨语言提示策略,仅使用英语监督数据即可有效适配新语言,使其成为无需昂贵大规模标注的MLODQA通用解决方案。
引用
@article{arxiv.2502.19722,
title = {Few-Shot Multilingual Open-Domain QA from 5 Examples},
author = {Fan Jiang and Tom Drummond and Trevor Cohn},
journal= {arXiv preprint arXiv:2502.19722},
year = {2025}
}
备注
Accepted by TACL; pre-MIT Press publication version