中文

ReVISE:基于视觉输入的自监督语音重合成用于通用与广义语音增强

音频与语音处理 2022-12-23 v1 计算机视觉与模式识别 机器学习 声音

摘要

先前利用视觉输入改善语音质量的研究通常分别探讨每种类型的听觉失真(例如,分离、修复、视频到语音),并提出针对性的算法。本文提出统一这些主题并研究广义语音增强,其目标不是重建精确的参考纯净信号,而是专注于改善语音的某些方面。具体而言,本文关注可懂度、质量和视频同步。我们将该问题转化为音频-视觉语音重合成,它由两个步骤组成:伪音频-视觉语音识别(P-AVSR)和伪文本到语音合成(P-TTS)。P-AVSR 和 P-TTS 通过从自监督语音模型导出的离散单元连接。此外,我们利用自监督音频-视觉语音模型来初始化 P-AVSR。所提出的模型被命名为 ReVISE。ReVISE 是首个用于自然场景下视频到语音合成的高质量模型,并使用单一模型在所有 LRS3 音频-视觉增强任务上取得了卓越的性能。为了展示其在现实世界中的适用性,ReVISE 还在 EasyCom 上进行了评估,这是一个在挑战性声学条件下收集的音频-视觉基准,仅有 1.6 小时的训练数据。同样地,ReVISE 极大地抑制了噪声并改善了质量。项目页面:https://wnhsu.github.io/ReVISE。

关键词

引用

@article{arxiv.2212.11377,
  title  = {ReVISE: Self-Supervised Speech Resynthesis with Visual Input for Universal and Generalized Speech Enhancement},
  author = {Wei-Ning Hsu and Tal Remez and Bowen Shi and Jacob Donley and Yossi Adi},
  journal= {arXiv preprint arXiv:2212.11377},
  year   = {2022}
}