使用 lyrics 对齐音频嵌入的可扩展音乐翻唱检索
声音
2026-01-19 v1 信息检索
机器学习
摘要
音乐翻唱检索,也称为版本识别,旨在识别同一基础音乐作品的不同演绎版本,这是目录管理、版权执行和音乐检索的核心任务。最新方法主要聚焦于和声和旋律特征,采用日益复杂的音频管道设计以对经常在翻唱版本间差异很大的音乐属性保持不变。虽然这些方法有效,但它们需要大量的训练时间和计算资源。相比之下,歌词是跨翻唱版本的强一致性,但其使用一直受限于从多音轨音频中准确高效提取的困难。早期方法依赖简单框架限制了下游性能,而更近期的系统虽然提供更强的结果,但需要大型模型集成于复杂的多模态架构之中。我们引入 LIVI (Lyrics-Informed Version Identification),以在检索准确率和计算效率之间取得平衡。首先,LIVI 利用来自最新转录和文本嵌入模型的监督信息,以在检索准确率上与或优于基于和声的系统。其次,LIVI 保持轻量高效,通过在推断时移除转录步骤,挑战了复杂管道的主导地位。
引用
@article{arxiv.2601.11262,
title = {Scalable Music Cover Retrieval Using Lyrics-Aligned Audio Embeddings},
author = {Joanne Affolter and Benjamin Martin and Elena V. Epure and Gabriel Meseguer-Brocal and Frédéric Kaplan},
journal= {arXiv preprint arXiv:2601.11262},
year = {2026}
}
备注
Published at ECIR 2026 (European Conference of Information Retrieval)