评估判别式与生成式端到端语音增强模型对音节重音保存的影响
音频与语音处理
2024-12-12 v1 声音
摘要
自动音节重音检测是计算机辅助语言学习(CALL)系统中关键组成部分,对于语言学习者至关重要。当前通常在干净语音上训练的重音检测模型在实际场景中可能不够稳健,因为背景噪声普遍存在。为此,可能采取语音增强(SE)模型来移除噪声,但其对保持音节重音模式的影响尚未得到充分研究。本研究考察了不同SE模型——代表判别式和生成式建模方法——在噪声环境下对音节重音检测的影响。我们通过将其应用于信噪比(SNR)从0到20 dB的语音数据,评估其在维持重音模式方面的效果。此外,我们探索了不同的特征集合,以确定在噪声中捕获重音模式最有效的特征。为进一步理解SE模型的影响,我们进行了基于人的感知研究,比较SE增强语音与干净语音中感知到的重音模式,从而提供关于这些模型在多大程度上保留音节重音的见解。实验在来自非德语和意大利语学习者的英语语音数据上进行。结果显示,在使用启发式特征时,生成式SE模型在重音检测性能方面表现稳健。此外,感知研究的观察在所有SE模型下都与重音检测结果一致。
引用
@article{arxiv.2412.08306,
title = {Evaluating the Impact of Discriminative and Generative E2E Speech Enhancement Models on Syllable Stress Preservation},
author = {Rangavajjala Sankara Bharadwaj and Jhansi Mallela and Sai Harshitha Aluru and Chiranjeevi Yarra},
journal= {arXiv preprint arXiv:2412.08306},
year = {2024}
}