TeEFusion:将文本嵌入融合以蒸馏无分类器引导
计算机视觉与模式识别
2025-07-28 v2
摘要
最近的文本到图像合成进展主要受益于复杂的抽样策略和无分类器引导(CFG)以确保高质量生成。然而,CFG 依赖两个前向传递,尤其是与复杂抽样算法结合时,导致推理成本高昂。为此,我们引入 TeEFusion(Text Embeddings Fusion),一种新型且高效的蒸馏方法,直接将引导幅度纳入文本嵌入中,并蒸馏教师模型的复杂抽样策略。通过简单的线性操作融合条件和无条件文本嵌入,TeEFusion 在不添加额外参数的情况下重建所需引导,同时使学生模型能够学习来自其复杂抽样方法生成的教师输出。在基于 SD3 等最先进模型的大量实验表明,我们的方法使学生模型能够在更简单和更高效的抽样策略下几乎模仿教师的性能。因此,学生模型的推理速度可提高最高可达 6 倍,而图像质量保持与教师复杂抽样方法相当。代码已公开于 https://github.com/AIDC-AI/TeEFusion。
引用
@article{arxiv.2507.18192,
title = {TeEFusion: Blending Text Embeddings to Distill Classifier-Free Guidance},
author = {Minghao Fu and Guo-Hua Wang and Xiaohao Chen and Qing-Guo Chen and Zhao Xu and Weihua Luo and Kaifu Zhang},
journal= {arXiv preprint arXiv:2507.18192},
year = {2025}
}
备注
Accepted by ICCV 2025. The code is publicly available at https://github.com/AIDC-AI/TeEFusion