中文

Syncphony:基于扩散 Transformer 的同步音频到视频生成

计算机视觉与模式识别 2025-09-29 v1

摘要

文本到视频和图像到视频生成在视觉质量上取得了快速进展,但在控制运动的精确时间方面仍存在局限。相比之下,音频提供了与视频运动对齐的时间线索,使其成为时间可控视频生成的理想条件。然而,由于间接的条件机制或有限的时间建模能力,现有的音频到视频(A2V)模型在细粒度同步方面存在困难。我们提出了 Syncphony,它生成 380x640 分辨率、24fps 的视频,并与多种音频输入同步。我们的方法建立在一个预训练的视频骨干网络上,并引入了两个关键组件以改善同步:(1) 运动感知损失,强调在高运动区域的学习;(2) 音频同步引导,使用一个不含音频层但视觉对齐的失步模型来引导整个模型,以便在推理时更好地利用音频线索,同时保持视觉质量。为了评估同步性,我们提出了 CycleSync,这是一种基于视频到音频的度量方法,通过测量生成视频中的运动线索量来重建原始音频。在 AVSync15 和 The Greatest Hits 数据集上的实验表明,Syncphony 在同步精度和视觉质量上均优于现有方法。项目页面见:https://jibin86.github.io/syncphony_project_page

关键词

引用

@article{arxiv.2509.21893,
  title  = {Syncphony: Synchronized Audio-to-Video Generation with Diffusion Transformers},
  author = {Jibin Song and Mingi Kwon and Jaeseok Jeong and Youngjung Uh},
  journal= {arXiv preprint arXiv:2509.21893},
  year   = {2025}
}

备注

Project page: https://jibin86.github.io/syncphony_project_page