中文

Flash-Unified:面向原生统一模型的无训练感知加速框架

计算机视觉与模式识别 2026-03-17 v1

摘要

原生统一多模态模型整合了生成和理解两项能力,但面临显著的计算开销,限制了其实际部署。现有加速技术通常采用静态、单一的策略,忽略了迭代生成任务(如图像生成)与单次传递理解任务(如 VQA)之间计算配置的根本差异。本文首次系统性分析了统一模型,揭示了显著的参数专化现象,即不同任务依赖不同的神经元集合。这表明在参数层面,统一模型隐式地在单一架构中内置了针对生成和理解的独立推理路径。基于这些洞见,我们引入了一个无训练感知且任务感知的加速框架 FlashU,针对不同任务的需求进行优化。我们提出任务特定网络剪枝和动态层跳过,以消除跨层和任务特定的冗余。对于视觉生成,我们实现了引导尺度的时间可变控制信号,以及通过扩散头缓存实现的扩散头的时序近似。对于多模态理解,在剪枝后的模型基础上,我们引入了基于 V 范数代理的动态标记剪枝,以利用视觉输入的空间冗余。广泛的实验在 Show-o2 上表明,FlashU 在理解和生成任务之间实现了 1.78 倍至 2.01 倍的推理加速,同时保持了 SOTA 水平,超越了竞争的统一模型,验证了我们的任务感知加速范式。我们的代码已公开于 https://github.com/Rirayh/FlashU。

关键词

引用

@article{arxiv.2603.15271,
  title  = {Flash-Unified: A Training-Free and Task-Aware Acceleration Framework for Native Unified Models},
  author = {Junlong Ke and Zichen Wen and Boxue Yang and Yantai Yang and Xuyang Liu and Chenfei Liao and Zhaorun Chen and Shaobo Wang and Linfeng Zhang},
  journal= {arXiv preprint arXiv:2603.15271},
  year   = {2026}
}

备注

Accepted by CVPR 2026 Findings