用于音乐音频标注的调制前端
声音
2021-05-26 v1 机器学习
音频与语音处理
摘要
卷积神经网络在自动音乐标注任务中已被广泛探索。该问题可通过使用人工设计的时间-频率特征或原始音频作为输入来解决。作为音色感知基础而被积极研究的调制滤波器组表示,有潜力促进感知显著特征的提取。我们探索用于音频表示学习的端到端学习前端 ModNet 和 SincModNet,其包含时间调制处理模块。该结构实际上类似于调制滤波器组,其中 FIR 滤波器中心频率以数据驱动方式学习。期望是具有感知动机的滤波器组能为识别音乐特征提供有用表示。我们的实验结果提供了原始音频的完全可可视化和可解释的前端时间调制分解。我们在 MagnaTagATune 数据集上针对音乐标注的当前最优(state-of-the-art)评估了模型的性能。我们分析了当时间-频率带被调制滤波器以逐步降低的速率下采样时,对特定标注性能的影响。我们证明,调制滤波为音乐标注和特征表示提供了有前景的结果,且在该前端设计中未使用广泛的音乐领域知识。
引用
@article{arxiv.2105.11836,
title = {A Modulation Front-End for Music Audio Tagging},
author = {Cyrus Vahidi and Charalampos Saitis and György Fazekas},
journal= {arXiv preprint arXiv:2105.11836},
year = {2021}
}