中文

使用序列到序列建模从无声视频中合成音频

声音 2024-04-30 v1 人工智能 计算机视觉与模式识别 机器学习 音频与语音处理

摘要

从视频的视觉上下文中生成音频在改善我们与视听媒体的交互方面具有多种实际应用,例如增强 CCTV 录像分析、修复历史视频(如无声电影)以及改进视频生成模型。我们提出了一种使用序列到序列模型从视频生成音频的新方法,改进了先前使用 CNN 和 WaveNet 且面临声音多样性和泛化挑战的工作。我们的方法采用 3D 矢量量化变分自编码器(VQ-VAE)来捕捉视频的空间和时间结构,并使用定制的音频解码器进行解码,以涵盖更广泛的声音范围。该模型在 Youtube8M 数据集片段上训练,专注于特定领域,旨在增强 CCTV 录像分析、无声电影修复和视频生成模型等应用。

关键词

引用

@article{arxiv.2404.17608,
  title  = {Synthesizing Audio from Silent Video using Sequence to Sequence Modeling},
  author = {Hugo Garrido-Lestache Belinchon and Helina Mulugeta and Adam Haile},
  journal= {arXiv preprint arXiv:2404.17608},
  year   = {2024}
}