基于时间调制的可学习前端用于音乐标注
音频与语音处理
2022-11-29 v1 声音
摘要
尽管端到端系统在包括自动音乐标注在内的听觉信号处理领域日益流行,但使用原始音频作为输入的模型在没有领域知识的情况下需要大量数据和计算资源。受时间调制被视为听觉感知中一个基本组成部分这一事实的启发,我们提出了时间调制神经网络(TMNN),它将类梅尔的数据驱动前端和时间调制滤波器与一个简单的ResNet后端相结合。该结构包含一组时间调制滤波器,用于捕获所有频率通道中的长期模式。实验结果表明,在MagnaTagATune数据集上进行自动音乐标注时,所提出的前端超越了最先进(SOTA)方法,并且它们也有助于语音命令的关键词识别。此外,针对每个标签的模型性能表明,具有复杂节奏的流派或乐器标签以及情绪标签尤其可以通过时间调制得到改善。
引用
@article{arxiv.2211.15254,
title = {Learnable Front Ends Based on Temporal Modulation for Music Tagging},
author = {Yinghao Ma and Richard M. Stern},
journal= {arXiv preprint arXiv:2211.15254},
year = {2022}
}
备注
Submitted to ICASSP 2023