中文

视觉注入的深度音频修复

计算机视觉与模式识别 2019-10-25 v1 机器学习 声音

摘要

多模态感知对于发展交互式智能至关重要。在这项工作中,我们考虑一项新的视觉信息注入音频修复任务,即合成与其伴随视频相对应的缺失音频片段。我们确定了成功的修复器所需的两个关键方面:(1) 最好在频谱图而非原始音频上操作。深度语义图像修复的最新进展可被利用以超越传统音频修复的局限。(2) 为合成视觉指示的音频,需要学习视觉-音频联合特征空间,并实现音频与视频的同步。为促进大规模研究,我们通过丰富 MUSIC 数据集收集了一个名为 MUSIC-Extra-Solo (MUSICES) 的新多模态乐器演奏数据集。大量实验表明,我们的框架能够在有或没有视觉上下文的情况下修复逼真且多样的音频片段。更重要的是,我们合成的音频片段与其视频对应部分相干,显示了我们提出的视觉注入音频修复器 (VIAI) 的有效性。代码、模型、数据集和视频结果可在 https://hangz-nju-cuhk.github.io/projects/AudioInpainting 获取。

关键词

引用

@article{arxiv.1910.10997,
  title  = {Vision-Infused Deep Audio Inpainting},
  author = {Hang Zhou and Ziwei Liu and Xudong Xu and Ping Luo and Xiaogang Wang},
  journal= {arXiv preprint arXiv:1910.10997},
  year   = {2019}
}

备注

To appear in ICCV 2019. Code, models, dataset and video results are available at the project page: https://hangz-nju-cuhk.github.io/projects/AudioInpainting