预测式与生成式语音增强模型对病理性语音的泛化能力
音频与语音处理
2025-09-24 v1
摘要
最先进的语音增强(Speech Enhancement, SE)模型在神经典型语音上取得了强劲的性能,但其对病理性语音的有效性大幅降低。在本文中,我们研究了弥合预测式和生成式 SE 模型这一差距的策略,包括 i) 使用病理性数据从头训练模型,ii) 用来自病理性语音的额外数据微调在神经典型语音上预训练的模型,以及 iii) 仅使用来自单个病理性测试说话人的数据进行特定说话人的个性化。我们的结果表明,尽管病理性语音数据集规模有限,但 SE 模型可以在此类数据上成功训练或微调。使用来自多名病理性说话人的数据微调模型可带来最大的性能提升,而特定说话人的个性化效果较差,这可能是由于每个说话人可用的数据量较少。这些发现突出了改善病理性说话人 SE 性能所面临的挑战和潜在策略。
引用
@article{arxiv.2509.18890,
title = {Generalizability of Predictive and Generative Speech Enhancement Models to Pathological Speakers},
author = {Mingchi Hou and Ante Jukic and Ina Kodrasi},
journal= {arXiv preprint arXiv:2509.18890},
year = {2025}
}