中文

学习乐器声音的多维解耦表示以用于音乐相似度评估

声音 2024-04-11 v1 音频与语音处理

摘要

为了实现灵活的推荐和检索系统,期望通过关注音乐作品的多个局部元素来计算音乐相似度,并允许用户选择他们想要关注的元素。先前的一项研究提出使用多个独立的网络基于每种乐器声音来计算音乐相似度,但在搜索系统中将每个信号用作查询是不切实际的。而使用分离的乐器声音由于伪影的存在会导致较低的准确性。在本文中,我们提出了一种使用单个网络计算关注每种乐器声音的相似度的方法,该网络以混合声音作为输入而不是单个乐器声音。具体而言,我们设计了一个具有每种乐器解耦维度的单一相似度嵌入空间,该空间由条件相似度网络提取,并使用带有掩码的三元组损失进行训练。实验结果表明:(1) 与使用分离声音作为输入的独立网络相比,所提出的方法可以获得更准确的特征表示;(2) 每个子嵌入空间可以保持相应乐器的特征;(3) 所提出的方法针对每种乐器声音关注选择相似音乐作品可以获得人类的认可,尤其是在鼓和吉他方面。

关键词

引用

@article{arxiv.2404.06682,
  title  = {Learning Multidimensional Disentangled Representations of Instrumental Sounds for Musical Similarity Assessment},
  author = {Yuka Hashizume and Li Li and Atsushi Miyashita and Tomoki Toda},
  journal= {arXiv preprint arXiv:2404.06682},
  year   = {2024}
}