基于重要性的令牌合并用于高效图像和视频生成
计算机视觉与模式识别
2025-04-28 v2
摘要
令牌合并通过仅处理相似令牌的组并在其之间共享结果,从而有效加速各种视觉系统。然而,现有的令牌分组方法往往随意且随机,忽略了样本实际内容。我们表明,在合并过程中保留高信息令牌——即对语义保真度和结构细节至关重要的令牌——显著提高样品质量,生成更细致、更连贯、更真实的生成结果。尽管这种方法简单直观,但仍未得到充分探索。为此,我们提出了一种基于重要性的令牌合并方法,优先在计算资源分配中处理最关键的令牌,利用可直接获取的重要性分数(如扩散模型中无分类器引导的重要性分数)。实验表明,我们的方法在多个应用中均显著优于基线方法,包括文本到图像合成、多视角图像生成以及使用 Stable Diffusion、Zero123++、AnimateDiff 或 PixArt- 等各种模型架构的视频生成。
引用
@article{arxiv.2411.16720,
title = {Importance-Based Token Merging for Efficient Image and Video Generation},
author = {Haoyu Wu and Jingyi Xu and Hieu Le and Dimitris Samaras},
journal= {arXiv preprint arXiv:2411.16720},
year = {2025}
}