Yuan-TecSwin:一种基于 Swin Transformer 块的文本条件扩散模型
计算机视觉与模式识别
2025-12-19 v1 人工智能
摘要
扩散模型凭借其U形架构和卷积神经网络(CNN)作为基本块,在图像合成方面展现出显著能力。CNN中卷积操作的局部性可能限制模型理解长程语义信息的能力。为解决这一问题,本工作提出 Yuan-TecSwin,一种带有 Swin Transformer 的文本条件扩散模型。Swin Transformer 块取代了编码器和解码器中的 CNN 块,以提升特征提取和图像恢复中的非局部建模能力。通过精心选择的文本编码器、对文本嵌入的有效利用以及文本条件融入的精心设计,文本-图像对齐性得到进一步提升。通过在不同扩散阶段采用自适应时间步进行搜索,推理性能进一步提升 10%。Yuan-TecSwin 在 ImageNet 生成基准测试上取得了 1.37 的最先进 FID 分数,且在不同的去噪阶段无需任何额外模型。在并排比较中,我们发现人类受访者难以区分模型生成的图像与人类绘制的图像。
引用
@article{arxiv.2512.16586,
title = {Yuan-TecSwin: A text conditioned Diffusion model with Swin-transformer blocks},
author = {Shaohua Wu and Tong Yu and Shenling Wang and Xudong Zhao},
journal= {arXiv preprint arXiv:2512.16586},
year = {2025}
}