基于深度网络的音乐音频缺陷检测
声音
2022-02-14 v1 机器学习
音频与语音处理
摘要
随着越来越多的音乐从制作端以数字方式传输到分发端,需要自动手段来确定媒体质量。数字音频处理工具中的保护机制并未消除位于分发链下游的制作实体评估音频质量并检测更上游插入的缺陷的需求。此类分析通常仅依赖接收到的音频和稀缺的元数据。在流行音乐中故意使用如咔嗒声之类的伪影,以及源自现代音频编码损坏的较新缺陷,都要求以数据为中心且对上下文敏感的解决方案来进行检测。我们提出了一种遵循端到端编码器-解码器配置的卷积网络架构,以开发针对两种示例性音频缺陷的检测器。训练了一个咔嗒声检测器并与传统信号处理方法进行比较,同时讨论了上下文敏感性。额外的后处理用于数据增强和工作流仿真。我们的模型捕捉方差的能力在针对损坏 MP3 压缩音频解压缩伪影的检测器中进行了探索。对于这两项任务,我们描述了用于受控检测器训练和评估的伪影合成生成方法。我们在大型开源 Free Music Archive (FMA) 和特定流派数据集上评估了我们的检测器。
引用
@article{arxiv.2202.05718,
title = {Audio Defect Detection in Music with Deep Networks},
author = {Daniel Wolff and Rémi Mignot and Axel Roebel},
journal= {arXiv preprint arXiv:2202.05718},
year = {2022}
}
备注
6 pages