中文

SynSonic:通过文本到音频扩散 ControlNet 与有效样本过滤增强声事件检测

音频与语音处理 2025-09-24 v1 人工智能 声音

摘要

由于时间标注数据的稀缺性,数据合成与增强对声事件检测(SED)至关重要。虽然 SpecAugment 和 Mix-up 等增强方法能够提升模型性能,但它们仍受限于现有样本的多样性。近期的生成模型提供了新机遇,然而由于缺乏精确的时间标注以及不可靠过滤引入噪声的风险,将其直接应用于 SED 具有挑战性。为应对这些挑战并实现基于生成的 SED 增强,我们提出了 SynSonic,一种针对该任务定制的数据增强方法。SynSonic 利用由能量包络 ControlNet 引导的文本到音频扩散模型,生成时间连贯的声事件。采用双分类器的联合评分过滤策略确保了样本质量,我们探索了其与训练流程的实际整合。实验结果表明,SynSonic 提升了多音声检测得分(PSDS1 和 PSDS2),增强了时间定位与声类区分能力。

关键词

引用

@article{arxiv.2509.18603,
  title  = {SynSonic: Augmenting Sound Event Detection through Text-to-Audio Diffusion ControlNet and Effective Sample Filtering},
  author = {Jiarui Hai and Mounya Elhilali},
  journal= {arXiv preprint arXiv:2509.18603},
  year   = {2025}
}