从视觉到声音:基于视觉算法的音频异常检测突破
声音
2025-02-26 v1 人工智能
计算机视觉与模式识别
音频与语音处理
摘要
近期的视觉异常检测 (VAD) 研究引入了利用预训练特征提取器生成的嵌入的高级算法。受这些发展的启发,我们探索了将此类算法适用于音频领域以解决音频异常检测 (AAD) 的方法。与大多数现有 AAD 方法不同,主要对异常样本进行分类,本方法引入了对异常在声谱图中进行细粒度时频定位的能力,显著提高了可解释性。这种能力使我们能够更精确地理解异常发生的具体位置和时间,从而使结果对最终用户更具行动价值。我们在工业和环境基准上评估了该方法,证明了 VAD 技术在检测音频信号异常方面的有效性。此外,它们通过启用局部异常识别,提高了可解释性,使音频异常检测系统更具可解释性和实用性。
引用
@article{arxiv.2502.18328,
title = {From Vision to Sound: Advancing Audio Anomaly Detection with Vision-Based Algorithms},
author = {Manuel Barusco and Francesco Borsatti and Davide Dalle Pezze and Francesco Paissan and Elisabetta Farella and Gian Antonio Susto},
journal= {arXiv preprint arXiv:2502.18328},
year = {2025}
}