中文

SynQuE:无需注释估计合成数据集质量

机器学习 2026-05-04 v5

摘要

我们提出并形式化了合成数据集质量估计(SynQuE)问题:仅通过有限无注释真实数据,对合成数据集进行排序,以预测其在真实世界任务上的表现。这一工作解决了一个关键且尚未解决的挑战:数据因收集成本或隐私限制而稀缺。我们引入首个综合基准,评估通过选择合成数据进行训练以最大化真实数据任务性能的代理指标。我们提出首批代理指标,通过改编分布和多样性基准的距离度量方式适用于本情境。为解决这些指标在复杂规划任务上的不足,我们提出LENS,一种新型代理方法,利用大语言模型推理能力捕捉细粒度特征。我们的实验表明,SynQuE代理指标在包括情感分析、Text2SQL、网页导航及图像分类等多样任务上与真实任务性能呈显著相关性,LENS在复杂任务上表现尤为突出,能够捕捉细微特征。例如,在文本到SQL解析任务中,依据SynQuE代理指标选取的前3名合成数据集,可使准确率平均提升8.1%(从30.4%提升至38.4%)。本工作建立了SynQuE作为面向真实数据稀缺情境下合成数据选择的实用框架,激励未来研究探索基于基础模型的数据表征与精细数据选择。我们已开源代码。

关键词

引用

@article{arxiv.2511.03928,
  title  = {SynQuE: Estimating Synthetic Dataset Quality Without Annotations},
  author = {Arthur Chen and Victor Zhong},
  journal= {arXiv preprint arXiv:2511.03928},
  year   = {2026}
}

备注

Our code and dataset are available here: https://github.com/r2llab/SynQuE