中文

基于自监督技术的歌手身份表征学习

声音 2024-01-11 v1 机器学习 音频与语音处理

摘要

在利用语音数据创建声音身份表征方面已取得显著进展。然而,针对歌声的同等进展尚未实现。为弥合这一差距,我们提出一个训练歌手身份编码器的框架,以提取适用于各种歌唱相关任务(如歌声相似度和合成)的表征。我们在一个大规模分离人声轨道集合上探索了不同的自监督学习技术,并在训练期间应用数据增强,以确保表征对音高和内容变化具有不变性。我们在多个数据集上评估了所得表征在歌手相似度和识别任务上的质量,特别强调了域外泛化能力。我们提出的框架生成了高质量的嵌入,在 44.1 kHz 运行频率下,其在歌声上的表现优于说话人验证和 wav2vec 2.0 预训练基线。我们发布了代码和训练模型,以促进歌声及相关领域的进一步研究。

关键词

引用

@article{arxiv.2401.05064,
  title  = {Singer Identity Representation Learning using Self-Supervised Techniques},
  author = {Bernardo Torres and Stefan Lattner and Gaël Richard},
  journal= {arXiv preprint arXiv:2401.05064},
  year   = {2024}
}

备注

Accepted at the ISMIR conference, Milan, Italy, 2023