EPG2S:基于舌腭电图与音频信号的多模态语音生成与语音增强系统
声音
2023-11-29 v1 机器学习
音频与语音处理
摘要
基于发音运动的语音生成与增强,在口头交流能力缺失(例如丧失说话能力的患者)时有助于沟通。尽管已提出多种技术,记录语音过程中舌与硬腭接触的监测技术——舌腭电图(EPG)——尚未得到充分探索。本文中,我们提出一种新颖的多模态EPG转语音(EPG2S)系统,利用EPG与语音信号进行语音生成与增强。我们考察了基于EPG与含噪语音信号多种组合的不同融合策略,并探究了所提方法的可行性。实验结果表明,EPG2S仅基于EPG信号即可取得理想的语音生成结果。进一步观察到,加入含噪语音信号可改善质量与可懂度。此外,观察到EPG2S仅基于音频信号即可实现高质量语音增强,而加入EPG信号可进一步提升性能。晚期融合策略被认为是同时进行语音生成与增强的最有效方法。
引用
@article{arxiv.2206.07860,
title = {EPG2S: Speech Generation and Speech Enhancement based on Electropalatography and Audio Signals using Multimodal Learning},
author = {Li-Chin Chen and Po-Hsun Chen and Richard Tzong-Han Tsai and Yu Tsao},
journal= {arXiv preprint arXiv:2206.07860},
year = {2023}
}
备注
Accepted By IEEE Signal Processing Letter