自引导在线数据筛选用于扩散模型训练
计算机视觉与模式识别
2026-05-18 v2 人工智能
机器学习
摘要
生成模型计算成本的重新引发了对高效数据筛选的希望与期待。本工作研究了近期的自引导(autoguidance)和在线数据选择方法能否提升生成扩散模型的训练时间和样本效率。我们将联合示例选择(JEST)和自引导集成到一个统一的代码库中,以实现快速的消融实验和基准测试。我们在受控的二维合成数据生成任务以及 (3x64x64)-D 图像生成任务上评估了多种数据筛选组合。我们在相等的挂钟时间和相等的样本数量下进行比较,明确考虑了选择的开销。实验结果表明,自引导一致地提升了样本质量与多样性。早期 AJEST(仅在训练开始时应用选择)在两项任务上的数据效率可与自引导相媲美或略有超越。然而,其时间开销和附加复杂性使得在大多数情况下自引导或均匀随机数据选择更为可取。这些发现表明,虽然有针对性的在线筛选可以在训练早期带来效率增益,但稳健的样本质量提升主要由自引导驱动。我们讨论了局限性与适用范围,并概述了数据筛选可能有益的情形。
引用
@article{arxiv.2509.15267,
title = {Autoguided Online Data Curation for Diffusion Model Training},
author = {Valeria Pais and Luis Oala and Daniele Faccio and Marco Aversa},
journal= {arXiv preprint arXiv:2509.15267},
year = {2026}
}
备注
Accepted non-archival paper at ICCV 2025 Workshop on Curated Data for Efficient Learning (CDEL)