神经语音增强中上下文特化的影响排序
音频与语音处理
2026-07-06 v1 声音
摘要
我们系统研究了神经语音增强系统,范围从非常小(约10k参数)到中大(约2-5M参数),这些系统利用说话人身份、噪声类型、说话人性别、口语和信噪比等上下文信息特化到声学条件。通过在特定数据子集上微调通用模型,我们发现特化到说话人身份始终能带来估计语音可懂度和质量的最大提升。相比之下,特化到信噪比、噪声类型或性别仅带来边际收益。至关重要的是,我们表明一个同时特化到特定说话人和特定噪声类型的小模型可以匹配或超过其十倍大小的通用模型的性能。此外,跨语言测试表明,特化到目标语言的模型优于多语言通用模型,这表明语言是特化的显著特征。这些发现凸显了小型自适应模型在资源受限应用(如助听器)中的潜力,这些应用可以实时特化到上下文信息。
引用
@article{arxiv.2607.04826,
title = {Ranking the Impact of Contextual Specialization in Neural Speech Enhancement},
author = {Peter Leer and Svend Feldt and Zheng-Hua Tan and Jan Østergaard and Jesper Jensen},
journal= {arXiv preprint arXiv:2607.04826},
year = {2026}
}
备注
Accepted to ICASSP 2026