MIMII-Gen:用于异常声音检测系统模拟评估的生成式建模方法
音频与语音处理
2024-09-30 v1 人工智能
声音
摘要
录音不足和异常情况的稀缺性,对开发和验证稳健的机器声音异常检测系统构成了重大挑战。为了解决这些局限性,我们提出了一种使用基于潜在扩散模型生成机器声音中多样化异常的新方法,该模型集成了编码器-解码器框架。我们的方法利用 Flan-T5 模型对源自音频文件元数据的文本描述进行编码,通过精心设计的 U-Net 架构实现条件生成。这种方法帮助我们的模型在 EnCodec 潜在空间中生成音频信号,确保了高度的上下文相关性和质量。我们使用 Fréchet 音频距离(FAD)分数和其他指标客观评估了生成声音的质量,结果表明我们的方法在生成紧密类似于实际异常状况的可靠机器音频方面超越了现有模型。使用我们生成的数据对异常检测系统进行评估显示出很强的相关性,其曲线下面积(AUC)分数与原始数据相差 4.8%,验证了我们生成数据的有效性。这些结果证明了我们的方法在增强各种及前所未见条件下异常检测系统的评估和稳健性方面的潜力。音频样本可在 \url{https://hpworkhub.github.io/MIMII-Gen.github.io/} 找到。
引用
@article{arxiv.2409.18542,
title = {MIMII-Gen: Generative Modeling Approach for Simulated Evaluation of Anomalous Sound Detection System},
author = {Harsh Purohit and Tomoya Nishida and Kota Dohi and Takashi Endo and Yohei Kawaguchi},
journal= {arXiv preprint arXiv:2409.18542},
year = {2024}
}