中文

CoRe²:收集、反思与精炼以生成更好更快的样本

计算机视觉与模式识别 2025-03-14 v1

摘要

使文本到图像 (T2I) 生成模型同时实现快速且高质量的采样是一个有前景的研究方向。先前研究通常要么以牺牲采样效率为代价增强合成图像的视觉质量,要么大幅加速采样而不改善基础模型的生成能力。此外,几乎所有推理方法都无法在扩散模型 (DMs) 和视觉自回归模型 (ARMs) 上同时保证稳定的性能。在本文中,我们引入了一种新型即插即用推理范式 CoRe²,包含三个子过程:收集、反思与精炼。CoRe² 首先收集无分类器引导 (CFG) 轨迹,然后利用收集的数据训练一个弱模型,该模型反映易于学习的内容,同时将推理过程中的函数评估次数减少一半。随后,CoRe² 采用弱到强引导来精炼条件输出,从而提高基础模型难以捕捉的高频和真实内容的生成能力。据我们所知,CoRe² 是首个在广泛的扩散模型(包括 SDXL、SD3.5 和 FLUX)以及 ARMs(如 LlamaGen)上同时展示效率和有效性的方法。它在 HPD v2、Pick-of-Pic、Drawbench、GenEval 和 T2I-Compbench 上表现出显著的性能提升。此外,CoRe² 可以与最先进的 Z-Sampling 无缝集成,在 PickScore 和 AES 上分别超越其 0.3 和 0.16,同时使用 SD3.5 实现 5.64 秒的时间节省。代码已发布于 https://github.com/xie-lab-ml/CoRe/tree/main。

关键词

引用

@article{arxiv.2503.09662,
  title  = {CoRe^2: Collect, Reflect and Refine to Generate Better and Faster},
  author = {Shitong Shao and Zikai Zhou and Dian Xie and Yuetong Fang and Tian Ye and Lichen Bai and Zeke Xie},
  journal= {arXiv preprint arXiv:2503.09662},
  year   = {2025}
}