中文

AV-Link:用于跨模态音视频生成的时序对齐扩散特征

计算机视觉与模式识别 2025-03-12 v2 机器学习 声音 音频与语音处理

摘要

我们提出AV-Link,一个统一的框架,用于视频到音频(A2V)和音频到视频(A2V)生成,利用冻结的视频和音频扩散模型激活进行时序对齐的跨模态条件。我们框架的关键在于一个融合模块,通过时序对齐的自注意力操作实现视频和音频扩散模型之间的双向信息交换。与使用专用模型处理A2V和V2A任务并依赖预训练特征提取器的先前工作不同,AV-Link在单个自包含框架中实现两个任务,直接利用互补模态获取的特征(即用视频特征生成音频,或用音频特征生成视频)。广泛的自动和主观评估表明,我们的方法在音视频同步方面实现了显著性改进,超越了更昂贵的基线,如电影生成视频到音频模型。

关键词

引用

@article{arxiv.2412.15191,
  title  = {AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation},
  author = {Moayed Haji-Ali and Willi Menapace and Aliaksandr Siarohin and Ivan Skorokhodov and Alper Canberk and Kwot Sin Lee and Vicente Ordonez and Sergey Tulyakov},
  journal= {arXiv preprint arXiv:2412.15191},
  year   = {2025}
}

备注

Project Page: snap-research.github.io/AVLink/