中文

基于自回归的视频语音同步音频

计算机视觉与模式识别 2024-09-23 v1 多媒体 声音 音频与语音处理

摘要

我们提出了 V-AURA,即首个实现高时序对齐性和相关性的自回归视频到音频生成模型。V-AURA 使用高帧率视觉特征提取器和跨模态音视频特征融合策略,以捕获细粒度的视觉运动事件,确保精确的时序对齐。此外,我们提出了 VisualSound,一个具有高音视频相关性的基准数据集。VisualSound 基于 VGGSound 构建,后者由来自 YouTube 的野生样本组成。在数据集构建过程中,我们移除了听觉事件与视觉事件未对齐的样本。V-AURA 在时序对齐和语义相关性方面超越了当前最先进的模型,同时保持了相当的音频质量。代码、样本、VisualSound 及模型均可在 https://v-aura.notion.site 访问。

关键词

引用

@article{arxiv.2409.13689,
  title  = {Temporally Aligned Audio for Video with Autoregression},
  author = {Ilpo Viertola and Vladimir Iashin and Esa Rahtu},
  journal= {arXiv preprint arXiv:2409.13689},
  year   = {2024}
}

备注

Submitted to ICASSP 2025. Project page https://v-aura.notion.site