中文

SaD:面向情景场景的语音增强判别器

声音 2025-09-10 v2 音频与语音处理

摘要

生成对抗网络(GAN)基于模型在语音增强领域显示出显著性能。然而,当前这些模型的优化策略主要关注改进生成器的体系结构或提升判别器的质量评估指标,往往忽视了来自不同情景场景中所蕴含的丰富上下文信息。本文提出一种情景感知判别器(scenario-aware discriminator),它捕获场景特定特征并执行频域分割,从而实现对生成器生成的增强语音进行更精确的质量评估。我们在三个具有代表性的模型上使用两个公开数据集进行了全面实验。结果表明,我们的方法能够在不改变生成器结构的情况下适应各种生成器体系结构,从而在不同情景下的语音增强中实现进一步的性能提升。

关键词

引用

@article{arxiv.2509.00405,
  title  = {SaD: A Scenario-Aware Discriminator for Speech Enhancement},
  author = {Xihao Yuan and Siqi Liu and Yan Chen and Hang Zhou and Chang Liu and Hanting Chen and Jie Hu},
  journal= {arXiv preprint arXiv:2509.00405},
  year   = {2025}
}

备注

5 pages, 2 figures. Accepted by InterSpeech2025