中文

TLDiffGAN:一种基于时序信息融合的潜在扩散-GAN框架用于异常声检测

声音 2026-02-03 v1 人工智能 音频与语音处理

摘要

现有无监督异常声检测的生成模型受限于无法充分捕捉正常声声学特征分布的复杂性,而强大的扩散模型在该领域的潜力仍基本未被探索。为此,我们提出一种新框架TLDiffGAN,包含两个互补的分支。一个分支将潜在扩散模型融入GAN生成器中进行对抗训练,从而增加判别器的任务难度,提高生成样本的质量。另一个分支利用预训练音频模型编码器从原始音频波形中直接提取特征进行辅助判别。该框架有效捕获来自原始音频和Mel频谱图的正常声特征表示。此外,我们引入TMixup频谱增强技术,以增强对细微且局部时序模式的敏感性,这些模式往往被忽视。在DCASE 2020 Challenge Task 2数据集上进行的大量实验表明,TLDiffGAN在异常检测性能方面具有优势,并且在异常时频定位方面展现出强大的能力。

关键词

引用

@article{arxiv.2602.01060,
  title  = {TLDiffGAN: A Latent Diffusion-GAN Framework with Temporal Information Fusion for Anomalous Sound Detection},
  author = {Chengyuan Ma and Peng Jia and Hongyue Guo and Wenming Yang},
  journal= {arXiv preprint arXiv:2602.01060},
  year   = {2026}
}

备注

Accepted by ICASSP 2026