少即是多:合成训练数据的自适应覆盖
机器学习
2025-07-28 v2
摘要
使用大语言模型(如Google的Gemma和OpenAI的GPT)生成合成训练数据,为训练分类器获取大规模标注数据集提供了可行方案。当模型快速部署至关重要时(例如分类新兴的社交媒体趋势或应对与当前事件相关的新型网络滥用),生成训练数据的能力便十分 invaluable。虽然已有研究考察了合成数据与人工标注数据的可比性,但本研究引入一种新型抽样算法,基于最大覆盖问题,从合成生成的数据集中选取具有代表性的子集。我们的实验结果表明,在该情境感知抽样子集上训练的分类器性能优于在完整数据集上训练。这一"少即是多"方法不仅提升模型准确率,还减少了所需数据量,进而可能更高效地进行模型微调。
关键词
引用
@article{arxiv.2504.14508,
title = {Less is More: Adaptive Coverage for Synthetic Training Data},
author = {Sasan Tavakkol and Max Springer and Mohammadhossein Bateni and Neslihan Bulut and Vincent Cohen-Addad and MohammadTaghi Hajiaghayi},
journal= {arXiv preprint arXiv:2504.14508},
year = {2025}
}