AADiff:基于文本到图像扩散的音频对齐视频合成
计算机视觉与模式识别
2023-05-24 v2 人工智能
摘要
扩散模型的最新进展在文本到视频 (T2V) 合成任务中展示了有前景的结果。然而,由于这些 T2V 模型仅以文本作为引导,它们往往难以建模精细的时间动态。本文中,我们引入一种新颖的 T2V 框架,其额外利用音频信号来控制时间动态,使一个现成的 T2I 扩散模型能够生成音频对齐的视频。我们提出基于音频的区域编辑与信号平滑,以在视频合成的两个矛盾需求(即时间灵活性与连贯性)之间取得良好平衡。我们通过实验实证展示了方法的有效性,并进一步给出了用于内容创作的实用应用。
引用
@article{arxiv.2305.04001,
title = {AADiff: Audio-Aligned Video Synthesis with Text-to-Image Diffusion},
author = {Seungwoo Lee and Chaerin Kong and Donghyeon Jeon and Nojun Kwak},
journal= {arXiv preprint arXiv:2305.04001},
year = {2023}
}
备注
CVPR2023 Workshop on AI for Content Creation. Project Page: https://lifrary.github.io/AADiff/