Transform Trained Transformer:加速 Naive 4K 视频生成的 Transformer retrofit 策略
计算机视觉与模式识别
2025-12-16 v1
摘要
Native 4K(2160×3840)视频生成仍是关键挑战 due to 全注意力在空间时间分辨率升高时产生二次计算爆炸,导致模型难以在效率与质量之间取得平衡。本文提出了一种 novel Transformer retrofit 策略,称为 (ransform rained ransformer),在不改变全注意力预训练模型核心架构的前提下,通过优化其前向逻辑显著降低计算需求。具体而言, 引入了多尺度权重共享窗口注意力机制,并通过层次化分块结合轴向保持全注意力设计,实现了对预训练模型的注意力模式转换,仅需适度的计算和数据资源。4K-VBench 上的结果表明, 在现有方法中显著超越:在保持性能提升(+4.29↑ VQA 和 +0.08↑ VTC)的同时,原生 4K 视频生成加速超过 10×。项目页面见 https://zhangzjn.github.io/projects/T3-Video
关键词
引用
@article{arxiv.2512.13492,
title = {Transform Trained Transformer: Accelerating Naive 4K Video Generation Over 10$\times$},
author = {Jiangning Zhang and Junwei Zhu and Teng Hu and Yabiao Wang and Donghao Luo and Weijian Cao and Zhenye Gan and Xiaobin Hu and Zhucun Xue and Chengjie Wang},
journal= {arXiv preprint arXiv:2512.13492},
year = {2025}
}
备注
Project page: https://zhangzjn.github.io/projects/T3-Video