中文

用于乐器基音音乐相似度学习的分离表示

声音 2025-07-18 v2 音频与语音处理

摘要

灵活的推荐和检索系统需要基于音乐作品多个部分元素的音乐相似度,以便用户选择所需关注的元素。使用多个具有各自乐器信号的网络进行音乐相似度学习的方法有效,但面临使用每个干净乐器信号作为查询不实用于检索系统以及使用分离的乐器信号会因人工效应而降低准确性的问题。本文提出了一种基于单个网络的乐器部分音乐相似度学习方法,输入为混合信号而非单个乐器信号。具体而言,我们设计了一个带有各乐器分离子空间的单一相似性嵌入空间,通过使用掩码进行三角损失训练的条件相似网络提取子空间。实验结果表明:(1) 所提出的方法在评估低准确性的乐器上,能够获得比使用分离信号作为输入的各个网络更准确的嵌入表示;(2) 每个子嵌入空间都能保存相应乐器的特征;(3) 所提出的方法可获得人类认可的选择结果,特别是在关注不同乐器声部时。

关键词

引用

@article{arxiv.2503.17281,
  title  = {Learning Separated Representations for Instrument-based Music Similarity},
  author = {Yuka Hashizume and Li Li and Atsushi Miyashita and Tomoki Toda},
  journal= {arXiv preprint arXiv:2503.17281},
  year   = {2025}
}

备注

arXiv admin note: text overlap with arXiv:2404.06682