中文

基于深度学习的视听语音修复

音频与语音处理 2021-02-04 v2 机器学习 图像与视频处理

摘要

在本文中,我们提出了一种基于深度学习的视听语音修复框架,即利用可靠的音频上下文和未损坏的视觉信息来恢复声学语音信号缺失部分的问题。近期工作仅关注纯音频方法,且通常旨在修复音乐信号,而音乐信号与语音的结构差异很大。相反,我们对缺失段从100 ms到1600 ms不等的语音信号进行修复,以探究视觉对不同持续时间缺失段所能提供的贡献。我们还尝试了一种多任务学习方法,将音素识别任务与语音修复一同学习。结果表明,纯音频语音修复方法的性能在缺失段变大时迅速下降,而所提出的视听方法能够合理地恢复缺失信息。此外,我们表明多任务学习是有效的,尽管对性能的最大贡献来自视觉。

关键词

引用

@article{arxiv.2010.04556,
  title  = {Audio-Visual Speech Inpainting with Deep Learning},
  author = {Giovanni Morrone and Daniel Michelsanti and Zheng-Hua Tan and Jesper Jensen},
  journal= {arXiv preprint arXiv:2010.04556},
  year   = {2021}
}

备注

Accepted at ICASSP 2021