在指令微调模型生成的合成数据上训练生成式问答系统
计算与语言
2023-10-16 v2
摘要
本文提出了一种简单且经济高效的数据合成方法,用于训练问答系统。在资源丰富的语言(如英语)中,微调 GPT 模型是常见做法,然而由于足够的问答(QA)对稀缺,在非英语语言中这变得具有挑战性。现有方法使用基于人工撰写的 QA 对训练的问答生成器,这涉及大量人力成本。相比之下,我们使用指令微调模型以零样本或少样本方式生成 QA 对。我们进行了实验,比较从该指令微调模型获取 QA 对的多种策略。结果表明,在我们提出的合成数据上训练的模型,达到了与在人工整理数据集上训练的模型相当的性能,且无需人力成本。
引用
@article{arxiv.2310.08072,
title = {Training Generative Question-Answering on Synthetic Data Obtained from an Instruct-tuned Model},
author = {Kosuke Takahashi and Takahiro Omi and Kosuke Arima and Tatsuya Ishigaki},
journal= {arXiv preprint arXiv:2310.08072},
year = {2023}
}
备注
PACLIC 2023 short paper, 4 pages (6 pages including references), 4 figures