CTCal:通过跨时步自校准来重新思考文本到图像扩散模型
计算机视觉与模式识别
2026-03-24 v1
摘要
近期文本到图像合成的进展主要由基于扩散的模型推动,但实现文本提示与生成图像之间的精确对齐仍是持续的挑战。我们发现,这一困难主要源于常规扩散损失的局限性,其仅提供对细粒度文本-图像对应关系的隐式监督。在本文中,我们引入跨时步自校准(CTCal),其基于建立在较小时步上形成的可靠文本-图像对齐(即交叉注意力图)与较大时步上更少噪声的表示学习之间的关系。我们进一步提出时序感知自适应加权,以实现 CTCal 与扩散损失的和谐集成。CTCal 是模型无关的,可无缝集成到现有的文本到图像扩散模型中,包括基于扩散的模型(如 SD 2.1)和基于流的模型(如 SD 3)。在 T2I-Compbench++ 和 GenEval 基准测试上进行大量实验表明,所提 CTCal 的有效性和通用性。我们的代码可在 https://github.com/xiefan-guo/ctcal 提供。
引用
@article{arxiv.2603.20741,
title = {CTCal: Rethinking Text-to-Image Diffusion Models via Cross-Timestep Self-Calibration},
author = {Xiefan Guo and Xinzhu Ma and Haiyu Zhang and Di Huang},
journal= {arXiv preprint arXiv:2603.20741},
year = {2026}
}
备注
Accepted by CVPR 2026