中文

基于GMM估计器的时间加权频域音频表示用于异常声音检测

音频与语音处理 2023-05-08 v1 声音

摘要

尽管深度学习是无监督异常声音检测的主流方法,但以统计音频频率表示为输入的高斯混合模型(GMM)能够以更低的模型复杂度和更少的参数取得可比的结果。现有的统计频率表示,例如对数梅尔谱图在时间上的平均或最大值,并非对所有机器都始终有效。本文提出时间加权频域表示(TWFR)结合 GMM 方法(TWFR-GMM)用于异常声音检测。TWFR 是一种广义的统计频域表示,可通过时域上的全局加权排序池化适应不同机器类型。这使得 GMM 估计器即使在域偏移条件下也能识别异常,如基于马氏距离的度量可视化所示。在 DCASE 2022 Challenge Task2 数据集上的实验表明,我们的方法比近期深度学习方法具有更好的检测性能。TWFR-GMM 是我们提交方案的核心,在 DCASE 2022 Challenge Task2 中获得了第 3 名。

关键词

引用

@article{arxiv.2305.03328,
  title  = {Time-weighted Frequency Domain Audio Representation with GMM Estimator for Anomalous Sound Detection},
  author = {Jian Guan and Youde Liu and Qiaoxi Zhu and Tieran Zheng and Jiqing Han and Wenwu Wang},
  journal= {arXiv preprint arXiv:2305.03328},
  year   = {2023}
}

备注

To appear at ICASSP 2023