中文

基于提示的少样本问答合成数据生成

计算与语言 2024-05-16 v1

摘要

尽管语言模型 (LMs) 已提升了问答任务的性能,但它们仍需要大量数据。数据标注与此相对,是一个耗时的过程。这一点在问答任务中尤为突出,因为可能需要解析和标注大量文档以生成问题及其对应的答案。此外,问答模型往往仅在其训练的 domain 中表现良好。鉴于标注成本高昂,我们认为语言模型中的 domain-agnostic 知识,如语言理解能力,足以创建高质量的数据集。出于此动机,我们展示了使用大型语言模型可在 various 数据集上以 few-shot setting 提升问答性能。为此,我们利用 Prompting 框架进行数据生成,表明语言模型包含可用于超越常见 pre-training/fine-tuning 框架的任务无关知识。结果表明,我们在少样本问答上持续优于先前方法。

关键词

引用

@article{arxiv.2405.09335,
  title  = {Prompting-based Synthetic Data Generation for Few-Shot Question Answering},
  author = {Maximilian Schmidt and Andrea Bartezzaghi and Ngoc Thang Vu},
  journal= {arXiv preprint arXiv:2405.09335},
  year   = {2024}
}

备注

LREC-COLING 2024