基于元数据辅助音频生成估计未知异常的首拍无监督异常声音检测
声音
2024-03-12 v2 音频与语音处理
摘要
首拍(FS)无监督异常声音检测(ASD)是 DCASE 2023 挑战赛任务 2 中引入的一项全新任务,其中目标机器类型的异常声音在训练中未见。现有方法通常依赖于来自目标机器的正常和异常声音数据的可用性。然而,由于缺少目标机器类型的异常声音数据,将现有 ASD 方法适配到首拍任务时变得具有挑战性。在本文中,我们提出了一种用于首拍无监督 ASD 的新框架,其中利用元数据辅助音频生成来估计未知异常,通过使用可用的机器信息(即元数据和声音数据)微调文本到音频生成模型,以生成包含对应每种不同机器类型独特声学特征的异常声音。然后,我们采用基于高斯混合模型的时域加权频域音频表示(TWFR-GMM)方法作为主干来实现首拍无监督 ASD。我们提出的 FS-TWFR-GMM 方法在 DCASE 2023 挑战赛任务 2 中于顶级系统间取得了有竞争力的性能,同时仅需 1% 的模型参数用于检测,正如我们的实验所验证的。
引用
@article{arxiv.2310.14173,
title = {First-Shot Unsupervised Anomalous Sound Detection With Unknown Anomalies Estimated by Metadata-Assisted Audio Generation},
author = {Hejing Zhang and Qiaoxi Zhu and Jian Guan and Haohe Liu and Feiyang Xiao and Jiantong Tian and Xinhao Mei and Xubo Liu and Wenwu Wang},
journal= {arXiv preprint arXiv:2310.14173},
year = {2024}
}
备注
Accepted at ICASSP 2024