AnoPatch: 提升机器异常声音检测中的一致性
声音
2024-06-18 v1 音频与语音处理
摘要
大型预训练模型在多个领域展示了主导性能,其中预训练和微调之间的一致性是成功的关键。然而,很少有工作报道预训练模型在机器异常声音检测任务中取得令人满意的结果。这可能是由于预训练模型与机器音频的归纳偏差不一致,导致数据和架构上的不一致。因此,我们提出了AnoPatch,它利用在AudioSet上预训练的ViT骨干网络,并在机器音频上进行微调。我们认为机器音频与音频数据集的相关性高于语音数据集,并且从补丁级别对其进行建模适合机器音频的稀疏性。因此,AnoPatch在DCASE 2020 ASD数据集和DCASE 2023 ASD数据集上展示了最先进的性能。我们还比较了多个预训练模型,并凭经验证明更好的一致性可以带来显著的改进。
引用
@article{arxiv.2406.11364,
title = {AnoPatch: Towards Better Consistency in Machine Anomalous Sound Detection},
author = {Anbai Jiang and Bing Han and Zhiqiang Lv and Yufeng Deng and Wei-Qiang Zhang and Xie Chen and Yanmin Qian and Jia Liu and Pingyi Fan},
journal= {arXiv preprint arXiv:2406.11364},
year = {2024}
}
备注
Accepted by INTERSPEECH 2024