Auto Cherry-Picker:从由语言驱动的高质量生成数据中学习
计算机视觉与模式识别
2025-03-25 v3
摘要
扩散模型能够生成逼真且多样的图像, potentially 为数据密集型感知任务提供数据可用的潜力。然而,利用这些模型来提升下游任务性能的潜力面临若干挑战,包括与真实数据分布的对齐、扩大合成样本规模以及确保数据质量。为弥合这些差距,我们提出了 Auto Cherry-Picker(ACP),一个用于生成大规模高质量跨模态训练样本以增强感知和多模态训练的新框架。ACP 首先使用大语言模型(LLM)根据真实数据先验中的对象组合,从而采样描述和布局,无需 ground-truth 图像标题或标注。接着,我们使用即插即用的可控扩散模型生成多个图像。然后,通过设计的综合度量——复合布局和图像得分(CLIS)——对生成数据进行精炼,以确保其质量。我们的定制化合成高质量样本在各种场景中都能显著提升性能,尤其是在解决长尾分布和不平衡数据集相关挑战方面。实验结果表明,ACP 能显著提升现有模型的性能。此外,我们发现 CLIS 与下游任务的性能提升呈正相关。这一发现表明评估指标在各种视觉感知和多模态大语言模型任务中发挥潜在作用。
引用
@article{arxiv.2406.20085,
title = {Auto Cherry-Picker: Learning from High-quality Generative Data Driven by Language},
author = {Yicheng Chen and Xiangtai Li and Yining Li and Yanhong Zeng and Jianzong Wu and Xiangyu Zhao and Kai Chen},
journal= {arXiv preprint arXiv:2406.20085},
year = {2025}
}
备注
Accepted to CVPR2025