EMGSE:用于多模态语音增强的声学/EMG融合
音频与语音处理
2022-02-15 v1 机器学习
声音
定量方法
摘要
多模态学习已被证明是提高语音增强(SE)性能的有效方法,尤其在低信噪比、语音噪声或未见噪声类型等挑战性情形下。在以往研究中,多种辅助数据被用于构建多模态SE系统,如唇部图像、腭电图或电磁矢状中面描记术。本文提出一种新颖的EMGSE多模态SE框架,其融合音频与面部肌电信号(EMG)。面部EMG是一种包含发音运动信息的生物信号,可以非侵入方式测量。实验结果表明,所提出的EMGSE系统比仅音频的SE系统取得更好性能。在挑战性环境下,融合EMG信号与声学信号对SE的益处显著。此外,本研究揭示颊部EMG足以用于SE。
引用
@article{arxiv.2202.06507,
title = {EMGSE: Acoustic/EMG Fusion for Multimodal Speech Enhancement},
author = {Kuan-Chen Wang and Kai-Chun Liu and Hsin-Min Wang and Yu Tsao},
journal= {arXiv preprint arXiv:2202.06507},
year = {2022}
}
备注
5 pages, 4 figures, and 3 tables