中文

基于人声模仿的鼓采样检索的深度条件表示学习

声音 2022-04-12 v1 信息检索 音频与语音处理

摘要

用人类声音模仿乐器是音乐制作人之间交流想法的有效方式,从勾勒旋律线到明确所需的音色皆然。因此,构建能够让艺术家仅通过人声模仿便从大型声音库中高效挑选目标采样 applications 的兴趣日益增长。在本研究中,我们探讨了条件自编码器模型在学习用于基于人声模仿的鼓采样检索(DSRV)的信息丰富特征方面的潜力。我们使用四种评估指标衡量了其嵌入的有用性,其中两种与其声学属性相关,另两种通过人类听者的相似性评分与其感知属性相关。结果表明,同时以声音类型标签(鼓声 vs 模仿声)和鼓类型标签(底鼓 vs 军鼓 vs 闭合踩镲 vs 开放踩镲)为条件的模型学到了对 DSRV 最具信息量的嵌入。最后,我们通过 Mantel 检验考察了人声模仿风格的个体差异,发现参与者之间存在显著差异,凸显了在设计 DSRV 系统时用户信息的重要性。

关键词

引用

@article{arxiv.2204.04651,
  title  = {Deep Conditional Representation Learning for Drum Sample Retrieval by Vocalisation},
  author = {Alejandro Delgado and Charalampos Saitis and Emmanouil Benetos and Mark Sandler},
  journal= {arXiv preprint arXiv:2204.04651},
  year   = {2022}
}

备注

Submitted to Interspeech 2022 (under review)