中文

用于可扩展长时长说话视频生成的多模态扩散Transformer带记忆库

计算机视觉与模式识别 2026-05-11 v5

摘要

长时长说话视频合成面临着在实现高质量视频、人物一致性、时间连贯性和计算效率方面存在持久挑战。随着视频时长的增加,视觉退化、人物漂移、时间性瑕疵和误差累积问题日益严重,严重影响结果的真实性和可靠性。为解决这些挑战,我们提出了LetsTalk,这是一个配备多模态引导和新颖记忆库机制的扩散转换器框架,旨在显式维护情境连续性,实现长时长说话视频的稳健、高质量和高效生成。在具体而言,LetsTalk引入了一种噪声正规化记忆库,以缓解在持续视频生成期间的误差累积和抽样瑕疵。为进一步提高效率和时空建模,LetsTalk采用深度压缩自编码器和具有线性注意力的时空感知转换器,以实现有效的多模态融合。我们系统地分析了三种融合方案,发现将人物特征采用深度融合(共生融合)、音频特征采用浅层融合(直接融合)可实现卓越的视觉真实性和精准的语音驱动运动,同时保持运动的多样性。大量实验表明,LetsTalk在生成质量上树立了新的研究前沿,能够产生时序连贯、真实可信的说话视频,增强了多样性和活力,还比以前的方法少了8倍的参数。

关键词

引用

@article{arxiv.2411.16748,
  title  = {Multimodal Diffusion Transformer with Memory Bank for Scalable Long-Duration Talking Video Generation},
  author = {Haojie Zhang and Zhihao Liang and Ruibo Fu and Bingyan Liu and Zhengqi Wen and Xuefei Liu and Jianhua Tao and Yaling Liang},
  journal= {arXiv preprint arXiv:2411.16748},
  year   = {2026}
}

备注

16 pages, 25 figures