中文

基于运动自适应的时空注意力机制用于轻量级视频生成

计算机视觉与模式识别 2026-03-19 v1

摘要

我们提出了一种用于基于冻结 Stable Diffusion 模型构建的参数高效视频生成的运动自适应时空注意力机制。不同于对所有视频内容统一处理,我们的方法会根据估计的运动内容动态调整时空注意力感受野:高运动序列在帧之间进行局部注意以保留快速变化的细节,而低运动序列进行全局注意以确保场景一致性。我们通过级联策略将轻量级时空注意力模块注入所有 UNet Transformer 块——在下采样和中间块中使用全局注意力以实现语义稳定,在上采样块中使用运动自适应注意力以实现细粒度细化。结合时序相关的噪声初始化和运动感知门控,该系统仅添加 25.8M 可训练参数(占基础 UNet 的 2.9%),在使用 100K 视频训练并在 WebVid 验证集上取得竞争成绩。我们展示,标准去噪目标本身提供了足够的隐式时序正则化,优于添加显式时序一致性损失的方法。我们的消融研究揭示了噪声相关性与运动幅度之间的明确权衡,为多样化的生成行为提供了实用的推理时控制。

关键词

引用

@article{arxiv.2603.17398,
  title  = {Motion-Adaptive Temporal Attention for Lightweight Video Generation with Stable Diffusion},
  author = {Rui Hong and Shuxue Quan},
  journal= {arXiv preprint arXiv:2603.17398},
  year   = {2026}
}

备注

6 pages, 3 figures, 4 tables. Published at IS&T Electronic Imaging 2026, GENAI Track