MERGE —— 用于静态音乐情感识别的双模态音频-歌词数据集
声音
2025-06-19 v3 信息检索
机器学习
多媒体
音频与语音处理
摘要
音乐情感识别 (MER) 领域近年来一直稳步发展,来自特征工程、机器学习和深度学习的贡献不断。但由于缺乏公开的、规模适中且经质量控制的双模态数据库,阻碍了双模态音频-歌词系统的开发与改进。本文提出了三个新的音频、歌词和双模态 MER 研究数据集,统称为 MERGE,使用半自动方法创建。为全面评估所提数据集并建立基准测试,本文为每个模态进行了若干实验,采用特征工程、机器学习和深度学习方法。此外,我们提出并验证了固定的训练-验证-测试划分。所得结果确认了所提数据集的可行性,在双模态分类中实现了最佳的 81.74% F1 分数。
引用
@article{arxiv.2407.06060,
title = {MERGE -- A Bimodal Audio-Lyrics Dataset for Static Music Emotion Recognition},
author = {Pedro Lima Louro and Hugo Redinho and Ricardo Santos and Ricardo Malheiro and Renato Panda and Rui Pedro Paiva},
journal= {arXiv preprint arXiv:2407.06060},
year = {2025}
}
备注
18 pages, 2 figures, 8 tables, submitted to IEEE Transactions on Affective Computing