中文

DGSNA:动态生成式基于场景的加噪方法

声音 2026-04-21 v6 音频与语音处理

摘要

为确保语音系统在多样环境中的可靠运行,加噪方法已成为标准解决方案。然而,现有方法对真实世界场景的覆盖有限,且依赖于预先存在的噪声库和场景元数据。本文提出了基于提示的动态生成式基于场景的加噪方法(DGSNA),这是一种由生成式语言模型驱动的新方法,将基于场景信息的动态生成(DGSI)与面向语音的基于场景加噪(SNAS)相结合。DGSI 模块采用 BET(背景、示例、任务)提示框架,动态生成符合逻辑的基于场景的信息,包括场景维度、声源和麦克风位置,从而解决了场景枚举和详细描述的挑战。作为补充,SNAS 模块采用基于时频扩散(TFD)的文本到音频模型来合成特定场景的噪声。通过房间脉冲响应(RIR)滤波器将此噪声与纯净语音整合,该模块简化了复制多样声学环境的传统高劳动密集型过程。实验结果表明,DGSNA 显著增强了语音识别和关键词 spotting 模型的鲁棒性,实现了高达 11.32% 的相对提升。此外,DGSNA 与现有的加噪技术高度兼容。我们的实现和演示可在 https://dgsna.github.io 获取。

关键词

引用

@article{arxiv.2411.12363,
  title  = {DGSNA: Dynamic Generative Scene-based Noise Addition method},
  author = {Zihao Chen and Zhentao Lin and Bi Zeng and Linyi Huang and Jia Cai},
  journal= {arXiv preprint arXiv:2411.12363},
  year   = {2026}
}