Source2Synth:基于真实数据源的合成数据生成与筛选
计算与语言
2025-08-21 v2 人工智能
摘要
合成数据生成近期已成为一种提升大型语言模型(LLMs)能力且无需昂贵人工标注的有前景的方法。然而,现有方法生成的数据往往质量低下或显得刻意。本文提出 Source2Synth,一种基于真实数据源的可扩展的合成数据生成与筛选方法。Source2Synth 将自定义数据源作为输入,并生成带有中间推理步骤的合成数据样本。该方法通过根据可回答性丢弃低质量生成结果来提升数据集质量。我们将该方法应用于利用两种不同类型数据的两个任务以证明其通用性:多跳问答(MHQA),利用文档测试复杂推理能力;以及表格问答(TQA),利用表格测试工具使用。与微调基线相比,该方法在 WikiSQL 上的 TQA 任务中提升了 25.51%,在 HotpotQA 上的 MHQA 任务中提升了 22.57%。
引用
@article{arxiv.2409.08239,
title = {Source2Synth: Synthetic Data Generation and Curation Grounded in Real Data Sources},
author = {Alisia Lupidi and Carlos Gemmell and Nicola Cancedda and Jane Dwivedi-Yu and Jason Weston and Jakob Foerster and Roberta Raileanu and Maria Lomeli},
journal= {arXiv preprint arXiv:2409.08239},
year = {2025}
}