将发音运动信息融入语音增强的研究
音频与语音处理
2021-06-10 v2
摘要
尽管深度学习算法被广泛用于提升语音增强(SE)性能,但在极具挑战性的条件下(如未见噪声或低信噪比(SNR)噪声信号),性能仍然有限。本研究对一种新颖的多模态音频-发音运动语音增强(AAMSE)模型进行了初步探索,以在此类挑战性条件下提升 SE 性能。发音运动特征与声学信号被用作基于波形映射和基于谱映射的 SE 系统的输入,并采用三种融合策略。此外,进行了消融实验以评估使用有限数量发音运动传感器时的 SE 性能。实验结果证实,与传统仅音频的 SE 基线相比,通过融合多模态,AAMSE 模型在语音质量与可懂度方面显著改善了 SE 性能。
引用
@article{arxiv.2011.01691,
title = {A Study of Incorporating Articulatory Movement Information in Speech Enhancement},
author = {Yu-Wen Chen and Kuo-Hsuan Hung and Shang-Yi Chuang and Jonathan Sherman and Xugang Lu and Yu Tsao},
journal= {arXiv preprint arXiv:2011.01691},
year = {2021}
}