中文

增强同步性的掩码生成视频到音频变换器

声音 2024-07-16 v1 人工智能 计算机视觉与模式识别 音频与语音处理

摘要

视频到音频 (V2A) 生成利用仅来自视频的视觉特征来生成与场景相符的合理声音。重要的是,生成的声音 onset 应与与之对齐的视觉动作相匹配,否则会产生不自然的同步性瑕疵。近期研究探索了将声音生成器从针对静态图像的条件推进到针对视频特征的条件,侧重于质量和语义匹配,同时忽略同步性,或通过牺牲部分质量来专注于改进同步性。本文提出了一种 V2A 生成模型,命名为 MaskVAT,将全频段高质量通用音频编解码器与序列到序列掩码生成模型相互关联。这一组合允许同时建模高音频质量、语义匹配和时间同步性。我们的结果表明,通过结合高质量编解码器、恰当的预训练音视频特征以及序列到序列并行结构,我们能够在一方面获得高度同步的结果,同时在非编解码器生成音频模型方面与当前最先进技术保持竞争力。样本视频和生成音频可在 https://maskvat.github.io 查看。

关键词

引用

@article{arxiv.2407.10387,
  title  = {Masked Generative Video-to-Audio Transformers with Enhanced Synchronicity},
  author = {Santiago Pascual and Chunghsin Yeh and Ioannis Tsiamas and Joan Serrà},
  journal= {arXiv preprint arXiv:2407.10387},
  year   = {2024}
}

备注

Accepted to ECCV 2024