Alchemist: 通过元梯度数据选择释放文本到图像模型训练中的效率
计算机视觉与模式识别
2025-12-19 v1
摘要
近期文本到图像(T2I)生成模型(如Imagen、Stable Diffusion和FLUX)的进展带来了视觉质量的显著提升。然而,其性能从根本上受到训练数据质量的限制。网络爬取和合成图像数据集通常包含低质量或冗余样本,导致视觉保真度下降、训练不稳定和计算效率低下。因此,有效的数据选择对于提高数据效率至关重要。现有方法依赖于昂贵的人工策划或基于T2I数据过滤中单维特征的启发式评分。虽然基于元学习的方法已在LLM中得到探索,但尚无针对图像模态的适配。为此,我们提出了**Alchemist**,一个基于元梯度的框架,用于从大规模文本-图像数据对中选择合适的子集。我们的方法通过从以数据为中心的视角迭代优化模型,自动评估每个样本的影响。Alchemist由两个关键阶段组成:数据评分和数据剪枝。我们训练了一个轻量级评分器,基于梯度信息估计每个样本的影响,并通过多粒度感知进行增强。然后我们使用Shift-G采样策略选择信息性子集以实现高效的模型训练。Alchemist是首个用于文本到图像模型训练的自动、可扩展、基于元梯度的数据选择框架。在合成和网络爬取数据集上的实验表明,Alchemist持续提升了视觉质量和下游性能。使用Alchemist选择的50%数据进行训练可以超越使用完整数据集进行训练。
引用
@article{arxiv.2512.16905,
title = {Alchemist: Unlocking Efficiency in Text-to-Image Model Training via Meta-Gradient Data Selection},
author = {Kaixin Ding and Yang Zhou and Xi Chen and Miao Yang and Jiarong Ou and Rui Chen and Xin Tao and Hengshuang Zhao},
journal= {arXiv preprint arXiv:2512.16905},
year = {2025}
}
备注
project page: https://kxding.github.io/project/Alchemist/