基于有限肌电通道的多模态语音增强
音频与语音处理
2025-01-14 v1 声音
摘要
语音增强旨在提高各种语音应用中的语音清晰度、可懂度和质量。然而,空气传导语音极易受到环境噪声的影响,特别是在低信噪比和非平稳噪声环境中。结合多模态信息在增强此类挑战性场景中的语音方面显示出前景。肌电信号捕获语音产生过程中的肌肉活动,具有抗噪声特性,有利于在恶劣条件下进行语音增强。以往大多数基于EMG的语音增强方法需要35个EMG通道,限制了其实用性。为了解决这个问题,我们提出了一种新颖的方法,仅考虑8通道EMG信号与声学信号,使用改进的SEMamba网络并添加跨模态模块。我们的实验表明,与传统方法相比,在语音质量和可懂度方面有显著改善,特别是在极低信噪比设置下。值得注意的是,与仅使用空气传导语音的方法相比,我们的方法在匹配的低SNR条件下实现了0.235的PESQ增益,在不匹配条件下实现了0.527的增益,突显了其鲁棒性。
引用
@article{arxiv.2501.06530,
title = {Multi-modal Speech Enhancement with Limited Electromyography Channels},
author = {Fuyuan Feng and Longting Xu and Rohan Kumar Das},
journal= {arXiv preprint arXiv:2501.06530},
year = {2025}
}
备注
Accepted by ICASSP 2025