基于提示的少样本问答合成数据生成
计算与语言
2024-05-16 v1
摘要
尽管语言模型 (LMs) 已提升了问答任务的性能,但它们仍需要大量数据。数据标注与此相对,是一个耗时的过程。这一点在问答任务中尤为突出,因为可能需要解析和标注大量文档以生成问题及其对应的答案。此外,问答模型往往仅在其训练的 domain 中表现良好。鉴于标注成本高昂,我们认为语言模型中的 domain-agnostic 知识,如语言理解能力,足以创建高质量的数据集。出于此动机,我们展示了使用大型语言模型可在 various 数据集上以 few-shot setting 提升问答性能。为此,我们利用 Prompting 框架进行数据生成,表明语言模型包含可用于超越常见 pre-training/fine-tuning 框架的任务无关知识。结果表明,我们在少样本问答上持续优于先前方法。
引用
@article{arxiv.2405.09335,
title = {Prompting-based Synthetic Data Generation for Few-Shot Question Answering},
author = {Maximilian Schmidt and Andrea Bartezzaghi and Ngoc Thang Vu},
journal= {arXiv preprint arXiv:2405.09335},
year = {2024}
}
备注
LREC-COLING 2024