基于分类器重构的判别性跨度作为合成数据效用的预测指标
计算机视觉与模式识别
2026-05-13 v2 机器学习
摘要
在包括医学成像和工业检测在内的许多现实世界计算机视觉应用中,二分类任务的特点是正样本严重稀缺。一种广泛采用的解决方案是对负样本应用图像到图像的变换来生成合成正样本数据。然而,一个基本的挑战仍然存在:我们如何可靠地评估此类合成数据是否会提升下游模型的性能?在这项工作中,我们提出了一种几何驱动的指标,可以在无需模型训练的情况下预测合成数据的效用。我们的方法在预训练基础模型的嵌入空间中运行,并通过样本间的差值向量来表示数据集。我们通过测量相对投影误差来评估线性分类器的权重向量是否可以在这些变化所张成的子空间内表示。直观上,如果合成数据引起的变化捕获了与任务相关的方向,它们的张成空间就可以逼近分类器,从而产生较低的投影误差。相反,劣质的合成数据无法张成这些方向,导致较高的误差。在多个数据集和架构上,我们表明该指标与在真实负样本和合成正样本混合数据上训练的 CNN 的下游分类性能表现出很强的相关性。这些发现表明,所提出的指标可作为在数据稀缺环境下评估合成数据质量的实用且信息丰富的工具。
引用
@article{arxiv.2605.09697,
title = {Discriminative Span as a Predictor of Synthetic Data Utility via Classifier Reconstruction},
author = {Radhika Amar Desai and Modigari Narendra},
journal= {arXiv preprint arXiv:2605.09697},
year = {2026}
}
备注
15 pages, 17 tables