探索自监督音频模型用于广义异常声音检测
声音
2025-08-19 v1 音频与语音处理
摘要
机器异常声音检测(ASD)是一项在多种应用中颇具价值的技术。然而,由于数据收集的挑战和声学环境的复杂性,其泛化性能常常受限。受大型预训练模型在众多领域取得成功的启发,本文引入了一种鲁棒的ASD模型,该模型利用在大规模语音和音频数据集上训练的自监督预训练模型。尽管预训练数据集与ASD任务之间存在不一致性,但我们的发现表明,预训练仍能为ASD带来实质性益处。为了在使用有限数据进行微调时减轻过拟合并保留已学知识,我们探索了全连接低秩适应(LoRA)作为完全微调的替代方案。此外,我们提出了一个机器感知组适配器模块,该模块使模型能够在统一框架内捕捉不同机器之间的差异,从而增强ASD系统的泛化性能。为解决属性标签缺失的挑战,我们设计了一种新颖的目标函数,该函数使用向量量化动态聚类无属性数据,并通过双层对比学习损失进行优化。所提出的方法在所有基准数据集上进行了评估,包括DCASE 2020-2024年的五项ASD挑战赛,实验结果显示我们的新方法有显著改进,并证明了所提出策略的有效性。
引用
@article{arxiv.2508.12230,
title = {Exploring Self-Supervised Audio Models for Generalized Anomalous Sound Detection},
author = {Bing Han and Anbai Jiang and Xinhu Zheng and Wei-Qiang Zhang and Jia Liu and Pingyi Fan and Yanmin Qian},
journal= {arXiv preprint arXiv:2508.12230},
year = {2025}
}
备注
Accepted by TASLP. 15 pages, 7 figures;