中文

CRAFT您的数据集:通过语料检索与增强生成任务特定的合成数据集

计算与语言 2025-12-08 v2 人工智能 机器学习

摘要

为特定任务构建高质量数据集是耗时且资源密集的过程,常需专业的领域知识。我们提出语料检索与增强用于微调 (CRAFT),一种给定少量用户编写的 few-shot 示例以生成合成数据集的方法。给定这些示例,CRAFT 使用大规模公开网页抓取语料库并进行相似性检索,以查找其他相关的人类编写文档。最后,指令微调的大型语言模型 (LLM) 将检索到的文档增强为自定义格式的任务样本,然后可用于微调。我们展示,CRAFT 能够高效生成四种多样化任务的大规模任务特定训练数据集:生物学、医学和常识问答 (QA),以及摘要。我们的实验表明,基于 CRAFT 的模型在 QA 任务上表现出色或与通用 LLM 持平,同时在摘要模型方面超过在人类精选数据上训练的模型 46 个偏好分。CRAFT 在初始 few-shot 质量变化的情况下仍能稳健工作,优于 Self 和 Evol-Instruct 等其他合成数据集生成方法。

关键词

引用

@article{arxiv.2409.02098,
  title  = {CRAFT Your Dataset: Task-Specific Synthetic Dataset Generation Through Corpus Retrieval and Augmentation},
  author = {Ingo Ziegler and Abdullatif Köksal and Desmond Elliott and Hinrich Schütze},
  journal= {arXiv preprint arXiv:2409.02098},
  year   = {2025}
}

备注

Accepted at TACL; Pre-MIT Press publication version. Code and dataset available at: https://github.com/ziegler-ingo/CRAFT