中文

MALT扩散:面向任意时长视频的记忆增强潜在Transformer

计算机视觉与模式识别 2025-07-09 v3 机器学习

摘要

扩散模型在合成高质量视频方面取得成功,但仅限于生成短片段(例如 2-10 秒)。合成持续镜头(例如数分钟)仍是开放问题。本文提出MALT扩散(使用记忆增强潜在Transformer),一种专为长视频生成设计的扩散模型。MALT扩散(或称为 MALT)通过将视频划分为短片段并进行片段级自回归生成来处理长视频。为此,首先提出循环注意力层,将多个片段编码为紧凑的记忆潜在向量;通过保持该记忆向量的时间连续性,MALT 能够基于长时序上下文条件生成新的画面。我们还 presented 多种训练技术,使模型能够在保持一致质量和最小退化的同时,生成长时序帧。我们通过实验在长视频基准测试中验证了 MALT 的有效性。我们首先在长情境理解能力和稳定性方面对 MALT 进行了广泛分析,使用流行的长视频基准测试。例如,MALT 在 UCF-101 上 128 帧视频生成的 FVD 分数为 220.4,显著优于之前的最先进技术的 648.4。最后,我们探索了 MALT 在文本到视频生成中的能力,表明其能够生成比最新技术更长的文本到视频。

关键词

引用

@article{arxiv.2502.12632,
  title  = {MALT Diffusion: Memory-Augmented Latent Transformers for Any-Length Video Generation},
  author = {Sihyun Yu and Meera Hahn and Dan Kondratyuk and Jinwoo Shin and Agrim Gupta and José Lezama and Irfan Essa and David Ross and Jonathan Huang},
  journal= {arXiv preprint arXiv:2502.12632},
  year   = {2025}
}

备注

CVPR 2025 Workshop on AI for Content Creation (Oral)