中文

块级级联:块因果视频模型的训练免费加速

计算机视觉与模式识别 2025-11-26 v1 人工智能

摘要

块因果视频生成面临明显的速度与质量权衡:小型13亿参数模型仅能实现16 FPS,而大型14亿参数模型速度仅为4.5 FPS,迫使用户在响应性与质量之间做出选择。块级级联通过训练免费的并行化显著缓解了这一权衡。我们的关键洞察:未来的视频块无需完全去噪当前块即可开始生成。通过以部分去噪的前驱上下文启动块生成,我们将顺序管道转化为并行级联,其中多个块同时去噪。采用5个GPU的时序并行,实现所有模型规模约2倍的加速:13亿参数模型从16 FPS加速至30 FPS,14亿参数模型从4.5 FPS加速至12.5 FPS。除推理速度外,块级级联还消除了在交互式生成期间进行上下文切换时因KV缓存(约200ms)产生的开销。广泛的评估验证了与多种块因果管道的对比,表明在从块因果管道切换到块级级联管道进行推理时,生成质量几乎没有显著损失。项目页面:https://hmrishavbandy.github.io/block_cascading_page/

关键词

引用

@article{arxiv.2511.20426,
  title  = {Block Cascading: Training Free Acceleration of Block-Causal Video Models},
  author = {Hmrishav Bandyopadhyay and Nikhil Pinnaparaju and Rahim Entezari and Jim Scott and Yi-Zhe Song and Varun Jampani},
  journal= {arXiv preprint arXiv:2511.20426},
  year   = {2025}
}