中文

FastCar:面向边缘设备的快速自回归视频生成的缓存注意力

计算机视觉与模式识别 2025-05-22 v1 人工智能

摘要

自回归(AR)模型最初在语言生成中取得成功,近期也在视觉生成任务中展现出优势。不同于图像生成,视频生成需要生成大量 token 以保证时间帧的连贯性,导致解码阶段开销显著。我们的关键观察包括:(i)解码阶段的 MLP 模块主导推理延迟;(ii)相邻帧 MLP 输出之间存在高度的时间冗余。本文提出了 \textbf{FastCar} 框架,通过探索时间冗余来加速 AR 视频生成的解码阶段。提出了时间注意力得分(TAS),以详细的理论分析和论证确定是否应用重播策略(即复用前一帧的缓存 MLP 输出以减少冗余计算)。我们还开发了基于 TAS 的 FPGA 硬件加速器,采用动态资源调度(DRS)以实现更好的资源利用和更快的推理。实验结果表明,我们的方法有效,超过传统稀疏注意力方法实现了2.1倍以上的解码加速,同时在边缘设备上实现更高的能源效率。此外,通过组合 FastCar 与稀疏注意力,FastCar 可在缓解漂移问题的同时提升稀疏注意力性能,凸显其在高分辨率和长时长视频生成中的独特优势。代码:https://github.com/shawnricecake/fast-car

关键词

引用

@article{arxiv.2505.14709,
  title  = {FastCar: Cache Attentive Replay for Fast Auto-Regressive Video Generation on the Edge},
  author = {Xuan Shen and Weize Ma and Yufa Zhou and Enhao Tang and Yanyue Xie and Zhengang Li and Yifan Gong and Quanyi Wang and Henghui Ding and Yiwei Wang and Yanzhi Wang and Pu Zhao and Jun Lin and Jiuxiang Gu},
  journal= {arXiv preprint arXiv:2505.14709},
  year   = {2025}
}

备注

Preprint Version