中文

FastSTAR:用于高效自回归视频合成的时空token剪枝

计算机视觉与模式识别 2026-03-10 v1

摘要

视觉自回归建模(VAR)已成为扩散框架中一种高效替代方案,实现了与扩散方法相当的合成质量。然而,当VAR范式扩展到视频生成的时空自回归建模(STAR)时,分辨率和帧数的不断提升导致“token爆炸”,在最终精炼阶段形成巨大的计算瓶颈。为此,我们提出FastSTAR——一个针对高质量视频生成设计的无训练加速框架。我们的核心方法时时空token剪枝,通过整合两个专门术语来识别关键token:(1)空间相似性,评估在层次尺度上的结构收敛情况,以跳过进一步精炼冗余的区域;(2)时空相似性,通过评估相对于前一帧的特征层级变化来识别活跃运动轨迹。结合局部更新机制,FastSTAR确保仅精炼未收敛的区域,维持流畅运动的同时跳过冗余计算。在InfinityStar上的实验结果表明,FastSTAR实现了最高可达2.01倍的加速,PSNR达到28.29,性能 degradation 小于1%,为STAR基视频生成展现出卓越的效率-质量权衡。

关键词

引用

@article{arxiv.2603.07192,
  title  = {FastSTAR: Spatiotemporal Token Pruning for Efficient Autoregressive Video Synthesis},
  author = {Sungwoong Yune and Suheon Jeong and Joo-Young Kim},
  journal= {arXiv preprint arXiv:2603.07192},
  year   = {2026}
}