你听到了吗?引入 AADG:用于音频异常检测基准数据生成的框架
声音
2024-10-08 v1 人工智能
音频与语音处理
摘要
我们介绍一种新型的、通用的音频生成框架,专为异常检测和定位设计。不同于现有数据集主要聚焦于工业和机器相关声音的做法,本框架关注更广泛的环境,尤其适用于仅有音频数据可用的实际场景,如视频派生或电话音频。为生成此类数据,我们提出一种受 LLM-Modulo 框架启发的新方法,该方法利用大语言模型(LLM)作为世界模型来模拟这些实际场景。该工具具有模块化设计,支持即插即用。它首先使用 LLM 预测合理的实际场景。随后,LLM 提取构成声音元素、顺序以及这些元素应如何合并以创建连贯整体的方式。类似 LLM-Modulo 框架,我们包括对每个输出阶段的严格验证,确保生成数据的可靠性。使用本框架生成的数据可作为异常检测应用的基准, potentially 提升训练有音频数据的模型在处理离群分布情况下的性能。我们的贡献因此填补了音频异常检测资源中的关键空白,提供了一种可扩展的工具,用于生成多样化且逼真的音频数据。
关键词
引用
@article{arxiv.2410.03904,
title = {Did You Hear That? Introducing AADG: A Framework for Generating Benchmark Data in Audio Anomaly Detection},
author = {Ksheeraja Raghavan and Samiran Gode and Ankit Shah and Surabhi Raghavan and Wolfram Burgard and Bhiksha Raj and Rita Singh},
journal= {arXiv preprint arXiv:2410.03904},
year = {2024}
}
备注
9 pages, under review