LACON:从未经筛选数据训练文本到图像模型
计算机视觉与模式识别
2026-03-31 v1 人工智能
摘要
现代文本到图像生成的成功在很大程度上归功于大规模高质量数据集。当前,这些数据集通过 filter-first 范式进行筛选,即根据假设低质量原始数据对模型性能有害而积极丢弃低质量数据。被丢弃的坏数据是否真的无用,还是蕴含着未被开发的潜力?本文对此问题进行了深入审视。我们提出LACON(Labeling-and-Conditioning),一种新颖的训练框架,利用其 underlying uncurated data distribution。不通过筛选,而是将 quality signals(如审美评分和水印概率)重新用作 explicit、量化的 condition labels。生成模型随后被训练以学习数据质量的完整谱系,从坏到好。通过学习高质量内容与低质量内容之间的显式边界,LACON在相同计算预算下使用仅来自筛选数据的基线实现了优异的生成质量,证明了未经筛选数据具有显著价值。
引用
@article{arxiv.2603.26866,
title = {LACON: Training Text-to-Image Model from Uncurated Data},
author = {Zhiyang Liang and Ziyu Wan and Hongyu Liu and Dong Chen and Qiu Shen and Hao Zhu and Dongdong Chen},
journal= {arXiv preprint arXiv:2603.26866},
year = {2026}
}