可行性真的重要吗?了解合成训练数据可行性的影响
计算机视觉与模式识别
2025-05-16 v1 人工智能
摘要
随着光照逼真扩散模型的发展,训练于合成数据(部分或全部)的模型已实现逐步提升的性能。 然而,扩散模型仍常规生成不存在于现实中的图像,如狗悬浮于地面或具有不切实际纹理细节的图像。 我们定义可行性为合成图像属性是否可能在现实世界域中真实存在;若包含违反此标准的属性的合成图像则视为不可行。 直观地认为,不可行图像通常被视为超出分布;因此,预期在现实数据上训练时会损害模型对真实数据的泛化能力,应尽可能从训练集中排除。 然而,可行性真的重要吗? 本文探讨在CLIP基分类器上生成合成训练数据的可行性是否必然。 我们关注三个目标属性:背景、颜色和纹理。 我们引入VariReal管线,对给定源图像进行最小编辑以包含由大型语言模型生成的可行或不可行属性。 我们的实验表明,可行性对LoRA微调CLIP性能影响有限,在三个细粒度数据集的Top-1准确率差异大多小于0.3%。 此外,属性是否在不可行图像上产生负面影响分类性能也 matters。 将可行与不可行图像混合进训练数据集,对性能影响不大,与仅使用纯可行或不可行数据集相比。
引用
@article{arxiv.2505.10551,
title = {Does Feasibility Matter? Understanding the Impact of Feasibility on Synthetic Training Data},
author = {Yiwen Liu and Jessica Bader and Jae Myung Kim},
journal= {arXiv preprint arXiv:2505.10551},
year = {2025}
}
备注
CVPRW 2025