中文

ADFF:基于注意力的深度特征融合音乐情感识别方法

声音 2022-07-01 v2 音频与语音处理

摘要

音乐情感识别(MER)作为音乐信息检索(MIR)的子任务,近年来发展迅速。然而,情感显著特征的学习仍具挑战。本文提出一种端到端的基于注意力的深度特征融合(ADFF)方法用于 MER。该方法仅以对数梅尔谱图为输入,使用改进的 VGGNet 作为空间特征学习模块(SFLM)以获取不同层级的空间特征。随后,这些特征被送入基于压缩激励(SE)注意力的时间特征学习模块(TFLM),得到多层次情感相关时空特征(ESTFs),其能在最终情感空间中较好地区分情感。此外,设计了一种新颖的数据处理,将单通道输入切分为多通道,在确保 MER 质量的同时提升计算效率。实验表明,相较于 SOTA 模型,所提方法在 R2 分数上分别实现了效价和唤醒度 10.43% 和 4.82% 的相对提升,同时在规模各异的数据集及多任务学习中表现更优。

关键词

引用

@article{arxiv.2204.05649,
  title  = {ADFF: Attention Based Deep Feature Fusion Approach for Music Emotion Recognition},
  author = {Zi Huang and Shulei Ji and Zhilan Hu and Chuangjian Cai and Jing Luo and Xinyu Yang},
  journal= {arXiv preprint arXiv:2204.05649},
  year   = {2022}
}

备注

It has been received by Interspeech2022