面向音乐情感识别的深度音频嵌入之比较与分析
声音
2021-04-15 v1 人工智能
机器学习
多媒体
音频与语音处理
摘要
情感是音乐中一种复杂的概念,即便借助精细的特征工程也难以捕捉。本文中,我们研究了最先进的预训练深度音频嵌入方法在音乐情感识别(MER)任务中的效用。深度音频嵌入方法使我们能将高维特征高效压缩为紧凑表示。我们采用若干深度音频嵌入实现多类分类器以预测音乐中的情感语义。我们考察了 L3-Net 与 VGGish 深度音频嵌入方法在四个音乐数据集上用于音乐情感推断的有效性。在該任务上采用若干分类器的实验表明,深度音频嵌入方案可改善先前基线 MER 模型的性能。我们得出结论:深度音频嵌入无需专家人工工程即可表征 MER 任务中的音乐情感语义。
引用
@article{arxiv.2104.06517,
title = {Comparison and Analysis of Deep Audio Embeddings for Music Emotion Recognition},
author = {Eunjeong Koh and Shlomo Dubnov},
journal= {arXiv preprint arXiv:2104.06517},
year = {2021}
}
备注
AAAI Workshop on Affective Content Analysis 2021 Camera Ready Version