中文

多说话人环境下基于 DNN 的视听语音增强中视觉特征的实证研究

音频与语音处理 2022-02-18 v1 计算机视觉与模式识别 机器学习 声音 图像与视频处理

摘要

视听语音增强(AVSE)方法同时使用音频和视觉特征来完成语音增强任务,并且已表明视觉特征在多说话人场景中尤其有效。在多数基于深度神经网络(DNN)的 AVSE 方法中,音频和视觉数据首先使用不同的子网络分别处理,然后将学习到的特征融合以利用来自两种模态的信息。关于合适的音频输入特征和网络架构已有各种研究,然而,据我们所知,尚未有已发表的研究探讨哪些视觉特征最适合这一特定任务。在本工作中,我们对基于 DNN 的 AVSE 中最常用的视觉特征、这些特征各自的预处理要求进行了实证研究,并考察它们对性能的影响。我们的研究表明,尽管基于嵌入的特征整体性能更优,但其计算密集的预处理使得它们在低资源系统中难以使用。对于此类系统,光流或基于原始像素的特征可能更为合适。

关键词

引用

@article{arxiv.2011.04359,
  title  = {An Empirical Study of Visual Features for DNN based Audio-Visual Speech Enhancement in Multi-talker Environments},
  author = {Shrishti Saha Shetu and Soumitro Chakrabarty and Emanuël A. P. Habets},
  journal= {arXiv preprint arXiv:2011.04359},
  year   = {2022}
}