中文

改进的轻量视听语音增强

音频与语音处理 2022-02-02 v3 机器学习 图像与视频处理

摘要

大量研究探讨了视听多模态学习在语音增强(AVSE)任务中的有效性,寻求一种利用视觉数据作为辅助与互补输入以降低含噪语音信号噪声的解决方案。近期,我们提出了一种面向驾车场景的轻量视听语音增强(LAVSE)算法。与传统AVSE系统相比,LAVSE所需的在线计算更少,并在一定程度上解决了面部数据的用户隐私问题。在本研究中,我们扩展了LAVSE以改进其处理AVSE系统实现中常遇到的三个实际问题的能力,即视觉数据处理附加成本、视听异步以及低质量视觉数据。所提出的系统被称为改进型LAVSE(iLAVSE),其采用卷积循环神经网络架构作为核心AVSE模型。我们在台湾普通话语音与视频数据集上评估了iLAVSE。实验结果证实,与传统AVSE系统相比,iLAVSE能有效克服上述三个实际问题并提升增强性能。结果还证实iLAVSE适用于真实世界场景,其中高质量视听传感器未必总可获得。

关键词

引用

@article{arxiv.2008.13222,
  title  = {Improved Lite Audio-Visual Speech Enhancement},
  author = {Shang-Yi Chuang and Hsin-Min Wang and Yu Tsao},
  journal= {arXiv preprint arXiv:2008.13222},
  year   = {2022}
}