ScoreMix:通过扩散模型中的得分组合生成合成数据以提高识别能力
计算机视觉与模式识别
2025-10-27 v2 人工智能
机器学习
摘要
合成数据生成在机器学习中用于训练和数据增强日益增长,然而当前方法常依赖外部基础模型或数据集,在许多场景下受到政策或法律限制。我们提出ScoreMix,一种自包含的合成生成方法,通过利用扩散模型的得分可组合性来为识别任务生成困难合成样本。该方法通过在逆扩散轨迹上混合类别条件得分,实现无外部资源的领域特定数据增强。我们系统研究了类别选择策略,发现混合在判别器嵌入空间中遥远的类别可获得更大提升,较基于接近性的选择方法多提升约3个百分点。有趣的是,我们观察到在标准对齐指标下,条件空间与嵌入空间大部分情况下不相关,生成器的条件空间对下游性能影响微乎其微。跨8个公开人脸识别基准测试,ScoreMix在准确率上提升最高可达7个百分点,且无需超参数搜索,凸显其鲁棒性和实用性。该方法为仅使用可用数据集而无需依赖第三方资源的方式,最大化判别器性能提供了一个简单而有效的途径。论文网站:https://parsa-ra.github.io/scoremix/。
引用
@article{arxiv.2506.10226,
title = {ScoreMix: Synthetic Data Generation by Score Composition in Diffusion Models Improves Recognition},
author = {Parsa Rahimi and Sebastien Marcel},
journal= {arXiv preprint arXiv:2506.10226},
year = {2025}
}
备注
Extended version of ICMLw25 Oral