中文

轻量级视听语音增强

音频与语音处理 2020-08-19 v3 计算与语言 声音

摘要

先前的研究已证实将视觉信息融入语音增强(SE)系统的有效性。尽管去噪性能有所提高,但在实现视听 SE(AVSE)系统时可能会遇到两个问题:(1)引入视觉输入会产生额外的处理成本;(2)使用面部或唇部图像可能导致隐私问题。在本研究中,我们提出了一种轻量级 AVSE(LAVSE)系统来解决这些问题。该系统包含两种视觉数据压缩技术,并从训练模型中移除了视觉特征提取网络,从而提高了在线计算效率。我们的实验结果表明,所提出的 LAVSE 系统在模型参数数量相似的情况下,能提供比纯音频 SE 系统显著更好的性能。此外,实验结果证实了这两种视觉数据压缩技术的有效性。

关键词

引用

@article{arxiv.2005.11769,
  title  = {Lite Audio-Visual Speech Enhancement},
  author = {Shang-Yi Chuang and Yu Tsao and Chen-Chou Lo and Hsin-Min Wang},
  journal= {arXiv preprint arXiv:2005.11769},
  year   = {2020}
}

备注

Accepted to Interspeech 2020