中文

从视觉到声音:基于视觉算法的音频异常检测突破

声音 2025-02-26 v1 人工智能 计算机视觉与模式识别 音频与语音处理

摘要

近期的视觉异常检测 (VAD) 研究引入了利用预训练特征提取器生成的嵌入的高级算法。受这些发展的启发,我们探索了将此类算法适用于音频领域以解决音频异常检测 (AAD) 的方法。与大多数现有 AAD 方法不同,主要对异常样本进行分类,本方法引入了对异常在声谱图中进行细粒度时频定位的能力,显著提高了可解释性。这种能力使我们能够更精确地理解异常发生的具体位置和时间,从而使结果对最终用户更具行动价值。我们在工业和环境基准上评估了该方法,证明了 VAD 技术在检测音频信号异常方面的有效性。此外,它们通过启用局部异常识别,提高了可解释性,使音频异常检测系统更具可解释性和实用性。

关键词

引用

@article{arxiv.2502.18328,
  title  = {From Vision to Sound: Advancing Audio Anomaly Detection with Vision-Based Algorithms},
  author = {Manuel Barusco and Francesco Borsatti and Davide Dalle Pezze and Francesco Paissan and Elisabetta Farella and Gian Antonio Susto},
  journal= {arXiv preprint arXiv:2502.18328},
  year   = {2025}
}