弥合多模态音乐表示学习中语义空间与用户偏好空间的差距
声音
2025-05-30 v1 信息检索
音频与语音处理
摘要
近期关于音乐表示学习的工作主要集中于利用无标签音频学习声学音乐表示,或进一步尝试利用稀缺的标注音频-文本对获取多模态音乐表示。它们要么忽略了语言语义,要么依赖于难以创建且成本高昂的标注音频数据集。此外,仅对语义空间进行建模通常无法在音乐推荐任务中取得令人满意的性能,因为用户偏好空间被忽略了。在本文中,我们提出了一种新颖的分层两阶段对比学习(HTCL)方法,该方法从语义视角到用户视角分层地建模相似性,以学习弥合语义空间与用户偏好空间之间差距的全面音乐表示。我们设计了一个可扩展的音频编码器,并利用预训练的 BERT 模型作为文本编码器,通过大规模对比预训练学习音频-文本语义。此外,我们探索了一种简单而有效的方法,利用来自我们在线音乐平台的交互数据,通过对比微调将语义空间适配到用户偏好空间,这不同于以往遵循协同过滤思想的工作。最终,我们获得了一个强大的音频编码器,它不仅从文本编码器中蒸馏出语言语义,还在保持语义空间完整性的同时对用户偏好空间中的相似性进行了建模。在音乐语义和推荐任务上的实验结果均证实了我们方法的有效性。
引用
@article{arxiv.2505.23298,
title = {Bridging the Gap Between Semantic and User Preference Spaces for Multi-modal Music Representation Learning},
author = {Xiaofeng Pan and Jing Chen and Haitong Zhang and Menglin Xing and Jiayi Wei and Xuefeng Mu and Zhongqian Xie},
journal= {arXiv preprint arXiv:2505.23298},
year = {2025}
}
备注
ICMR 2025