中文

在指令微调模型生成的合成数据上训练生成式问答系统

计算与语言 2023-10-16 v2

摘要

本文提出了一种简单且经济高效的数据合成方法,用于训练问答系统。在资源丰富的语言(如英语)中,微调 GPT 模型是常见做法,然而由于足够的问答(QA)对稀缺,在非英语语言中这变得具有挑战性。现有方法使用基于人工撰写的 QA 对训练的问答生成器,这涉及大量人力成本。相比之下,我们使用指令微调模型以零样本或少样本方式生成 QA 对。我们进行了实验,比较从该指令微调模型获取 QA 对的多种策略。结果表明,在我们提出的合成数据上训练的模型,达到了与在人工整理数据集上训练的模型相当的性能,且无需人力成本。

关键词

引用

@article{arxiv.2310.08072,
  title  = {Training Generative Question-Answering on Synthetic Data Obtained from an Instruct-tuned Model},
  author = {Kosuke Takahashi and Takahiro Omi and Kosuke Arima and Tatsuya Ishigaki},
  journal= {arXiv preprint arXiv:2310.08072},
  year   = {2023}
}

备注

PACLIC 2023 short paper, 4 pages (6 pages including references), 4 figures