中文

CrossMuSim:结合 LLM 驱动的文本描述获取与挖掘的音乐相似性检索跨模态框架

声音 2025-05-26 v2 人工智能 音频与语音处理

摘要

音乐相似性检索是流媒体平台管理和探索大型曲库中相关内容的基础。本文提出了一种新颖的跨模态对比学习框架,利用文本描述的开放式特性来指导音乐相似性建模,解决了传统单模态方法在捕捉复杂音乐关系方面的局限性。为了克服高质量文本-音乐配对数据的稀缺性,本文引入了一种结合在线抓取和基于 LLM 的提示的双源数据获取方法,其中精心设计的提示利用 LLM 全面的音乐知识来生成上下文丰富的描述。广泛的实验表明,通过客观指标、主观评估以及在华为音乐流媒体平台上的真实世界 A/B 测试,所提出的框架相较于现有基准取得了显著的性能提升。

关键词

引用

@article{arxiv.2503.23128,
  title  = {CrossMuSim: A Cross-Modal Framework for Music Similarity Retrieval with LLM-Powered Text Description Sourcing and Mining},
  author = {Tristan Tsoi and Jiajun Deng and Yaolong Ju and Benno Weck and Holger Kirchhoff and Simon Lui},
  journal= {arXiv preprint arXiv:2503.23128},
  year   = {2025}
}

备注

Accepted by ICME2025