中文

Skrr:面向文本到图像生成的跳过与重用文本编码器层

机器学习 2025-02-14 v1 人工智能 计算机视觉与模式识别

摘要

大规模文本编码器在文本到图像(T2I)扩散模型中已展现出在从文本提示生成高质量图像方面的卓越性能。与依赖多个迭代步骤的去噪模块不同,文本编码器仅需一次前向传播即可生成文本嵌入。然而,尽管其对总体推理时间和浮点运算量(FLOPs)的贡献微乎其微,文本编码器却需求显著更高的内存,最高可达去噪模块的八倍。为解决这一效率问题,我们提出了一种专为T2I扩散模型文本编码器设计的简单且有效的剪枝策略,称为跳过与重用层(Skrr)。Skrr利用Transformer模块中固有的冗余性,通过针对T2I任务有选择性地跳过或重用某些层,以降低内存消耗而不牺牲性能。大量实验表明,Skrr即使在高稀疏度下也能保持与原模型相当的图像质量,优于现有的基于块的剪枝方法。此外,Skrr在保持性能的同时实现了最高的内存效率, across multiple evaluation metrics,包括FID、CLIP、DreamSim和GenEval分数。

关键词

引用

@article{arxiv.2502.08690,
  title  = {Skrr: Skip and Re-use Text Encoder Layers for Memory Efficient Text-to-Image Generation},
  author = {Hoigi Seo and Wongi Jeong and Jae-sun Seo and Se Young Chun},
  journal= {arXiv preprint arXiv:2502.08690},
  year   = {2025}
}