中文

对比性声乐相似性建模

音频与语音处理 2025-10-06 v1 声音

摘要

大规模无标签数据集的可用性推动了众多方法的发展,这些方法通过自监督预训练在多个目标(下游)任务上学习表示。本文我们引入了 CVSM(Contrastive Vocal Similarity Modeling),这是一种用于音频领域的对比自监督声乐表示学习方法,可用于音乐和声乐相似性建模。我们的方法基于对比框架,最大化包含相同声乐的声乐片段与音乐混合信号之间的相似性;我们设计了既有的标签信息方案,利用演员身份信息对采样对比对进行标签;也设计了无标签方案,涉及从随机采样的声乐片段和伴奏片段中人工创建混合信号,这些混合信号与来自相同音频段的声乐进行配对。在衡量声乐相似性方面,我们在客观上通过对一系列合适的下游任务进行线性探针进行评估;在主观方面,通过进行用户研究,进行不同模型在以查询为导向的推荐中的成对比较。我们的结果表明,通过 CVSM 学习到的表示在音乐和声乐相似性建模方面有效,对比众多基线在孤立声乐和完整音乐混合信号上都表现更好。此外,虽然在预训练期间使用演员身份标签会导致在所评估的下游任务和用户研究中整体表现更一致,但一种无标签的 CVSM 变体通过结合真实混合和人工混合进行混合预训练,在演员识别和感知声乐相似性方面,达到了与有标签方案相当的性能。

关键词

引用

@article{arxiv.2510.03025,
  title  = {CVSM: Contrastive Vocal Similarity Modeling},
  author = {Christos Garoufis and Athanasia Zlatintsi and Petros Maragos},
  journal= {arXiv preprint arXiv:2510.03025},
  year   = {2025}
}

备注

13 pages, 3 tables, 8 figures. Submitted article at IEEE Trans. on Audio, Speech and Language Proc. (pre-print version)