中文

EMGSE:用于多模态语音增强的声学/EMG融合

音频与语音处理 2022-02-15 v1 机器学习 声音 定量方法

摘要

多模态学习已被证明是提高语音增强(SE)性能的有效方法,尤其在低信噪比、语音噪声或未见噪声类型等挑战性情形下。在以往研究中,多种辅助数据被用于构建多模态SE系统,如唇部图像、腭电图或电磁矢状中面描记术。本文提出一种新颖的EMGSE多模态SE框架,其融合音频与面部肌电信号(EMG)。面部EMG是一种包含发音运动信息的生物信号,可以非侵入方式测量。实验结果表明,所提出的EMGSE系统比仅音频的SE系统取得更好性能。在挑战性环境下,融合EMG信号与声学信号对SE的益处显著。此外,本研究揭示颊部EMG足以用于SE。

关键词

引用

@article{arxiv.2202.06507,
  title  = {EMGSE: Acoustic/EMG Fusion for Multimodal Speech Enhancement},
  author = {Kuan-Chen Wang and Kai-Chun Liu and Hsin-Min Wang and Yu Tsao},
  journal= {arXiv preprint arXiv:2202.06507},
  year   = {2022}
}

备注

5 pages, 4 figures, and 3 tables