中文

Transform Trained Transformer:加速 Naive 4K 视频生成的 Transformer retrofit 策略

计算机视觉与模式识别 2025-12-16 v1

摘要

Native 4K(2160×3840)视频生成仍是关键挑战 due to 全注意力在空间时间分辨率升高时产生二次计算爆炸,导致模型难以在效率与质量之间取得平衡。本文提出了一种 novel Transformer retrofit 策略,称为 T3\textbf{T3}T\textbf{T}ransform T\textbf{T}rained T\textbf{T}ransformer),在不改变全注意力预训练模型核心架构的前提下,通过优化其前向逻辑显著降低计算需求。具体而言,T3-Video\textbf{T3-Video} 引入了多尺度权重共享窗口注意力机制,并通过层次化分块结合轴向保持全注意力设计,实现了对预训练模型的注意力模式转换,仅需适度的计算和数据资源。4K-VBench 上的结果表明,T3-Video\textbf{T3-Video} 在现有方法中显著超越:在保持性能提升(+4.29↑ VQA 和 +0.08↑ VTC)的同时,原生 4K 视频生成加速超过 10×。项目页面见 https://zhangzjn.github.io/projects/T3-Video

关键词

引用

@article{arxiv.2512.13492,
  title  = {Transform Trained Transformer: Accelerating Naive 4K Video Generation Over 10$\times$},
  author = {Jiangning Zhang and Junwei Zhu and Teng Hu and Yabiao Wang and Donghao Luo and Weijian Cao and Zhenye Gan and Xiaobin Hu and Zhucun Xue and Chengjie Wang},
  journal= {arXiv preprint arXiv:2512.13492},
  year   = {2025}
}

备注

Project page: https://zhangzjn.github.io/projects/T3-Video