基于预训练嵌入的可解释且感知对齐音乐相似性
声音
2026-01-28 v1
摘要
感知相似性表示使音乐检索系统能够确定哪些歌曲最符合听者的感知。基于自监督度量学习的任务特定方法显示出与人类判断的良好对齐,但由于数据集可用性受限,难以解释或泛化。我们表明,预训练文本-音频嵌入 (CLAP 和 MuQ-MuLan) 在相似性任务中无需额外微调即可实现相当的感知对齐。为超越此基线,我们提出一种新方法,通过源分离和线性优化对预训练嵌入进行感知对齐,基于听力测试中的 ABX 偏好数据。我们的模型提供可解释且可控制的乐器级别权重,使音乐制作人能够根据混合参考歌曲检索 stem 级别的循环和样本。
引用
@article{arxiv.2601.19109,
title = {Interpretable and Perceptually-Aligned Music Similarity with Pretrained Embeddings},
author = {Arhan Vohra and Taketo Akama},
journal= {arXiv preprint arXiv:2601.19109},
year = {2026}
}