中文

利用大语言模型嵌入实现跨数据集标签对齐与零样本音乐情感预测

声音 2024-10-18 v2 机器学习 多媒体 音频与语音处理

摘要

在这项工作中,我们提出了一种新颖的音乐情感识别方法,该方法利用大语言模型(LLM)嵌入实现跨多个数据集的标签对齐以及对新类别的零样本预测。首先,我们计算情感标签的LLM嵌入,并应用非参数聚类将来自多个包含不重叠标签的数据集中的相似标签分组。我们使用这些聚类中心将音乐特征(MERT)映射到LLM嵌入空间。为进一步增强模型,我们引入了一种对齐正则化,使得来自不同聚类的MERT嵌入能够解耦。这进一步增强了模型对未见数据集的适应能力。我们通过对一个新数据集进行零样本推理来展示我们方法的有效性,证明了其无需额外训练即可泛化到未见标签的能力。

关键词

引用

@article{arxiv.2410.11522,
  title  = {Leveraging LLM Embeddings for Cross Dataset Label Alignment and Zero Shot Music Emotion Prediction},
  author = {Renhang Liu and Abhinaba Roy and Dorien Herremans},
  journal= {arXiv preprint arXiv:2410.11522},
  year   = {2024}
}