中文

Attend to Not Attended: 基于结构-细节 Token 合并的后训练扩散转换器加速

计算机视觉与模式识别 2025-05-20 v1

摘要

扩散转换器在视觉生成中显示出卓越的性能,但计算成本高昂。已引入通过在相似标记之间共享去噪过程来压缩模型的 token 减少技术。然而,现有方法忽略了扩散模型的去噪先验,导致加速次佳且图像质量下降。本研究提出了一种新概念:关注未被扩散过程关注的区域,以修剪特征冗余。我们基于结构-细节去噪先验分析特征冗余的区域和程度。随后,我们引入 SDTM(结构-细节 token 合并方法),动态压缩特征冗余。具体而言,我们设计了动态视觉标记合并、压缩比率调整以及针对不同阶段的提示重加权。以后训练方式呈现,所提出的方法可以无缝集成到任何 DiT 架构中。广泛的实验在 various backbones、schedulers 和 datasets 上展示了我们方法的优越性,例如,它实现了 1.55 倍的加速,同时对图像质量影响微乎其微。项目页面: https://github.com/ICTMCG/SDTM。

关键词

引用

@article{arxiv.2505.11707,
  title  = {Attend to Not Attended: Structure-then-Detail Token Merging for Post-training DiT Acceleration},
  author = {Haipeng Fang and Sheng Tang and Juan Cao and Enshuo Zhang and Fan Tang and Tong-Yee Lee},
  journal= {arXiv preprint arXiv:2505.11707},
  year   = {2025}
}

备注

Comments: 14 pages, 14 figures. Accepted by the Proceedings of the 42nd IEEE/CVF Conference on Computer Vision and Pattern Recognition