KeyVID:基于关键帧的时间序列视频扩散用于音频同步视觉动画
计算机视觉与模式识别
2025-10-17 v2
摘要
从文本、图像和音频等各种条件生成视频,实现对空间和时间的控制,从而产生高质量的结果。具有戏剧性运动的视频通常需要更高的帧率以确保平滑的运动。当前,大多数音频到视觉动画模型使用从视频剪辑中均匀抽取的帧。然而,这些均匀抽取的帧在低帧率下无法捕捉戏剧性运动中的关键时刻,并且在增加帧数时需要显著更多的内存。本文提出了 KeyVID,一种面向音频信号关键时刻的关键帧感知音频到视觉动画框架,在保持计算效率的同时显著提高关键时刻的生成质量。给定图像和音频输入后,我们首先从音频中局化关键时间步骤。然后,我们使用关键帧生成器生成相应的视觉关键帧。最后,我们使用运动插值器生成所有中间帧。通过大量实验,我们展示了 KeyVID 在多个数据集上显著改善了音频视频同步和视频质量,尤其是针对高度动态的运动。代码已发布于 https://github.com/XingruiWang/KeyVID。
引用
@article{arxiv.2504.09656,
title = {KeyVID: Keyframe-Aware Video Diffusion for Audio-Synchronized Visual Animation},
author = {Xingrui Wang and Jiang Liu and Ze Wang and Xiaodong Yu and Jialian Wu and Ximeng Sun and Yusheng Su and Alan Yuille and Zicheng Liu and Emad Barsoum},
journal= {arXiv preprint arXiv:2504.09656},
year = {2025}
}