中文

利用说话人识别方法学习和评估乐器声音嵌入表示

音频与语音处理 2021-12-28 v2 声音

摘要

为乐器声音构建一个能够有意义地表示新颖且未见过乐器的嵌入空间,对于多乐器合成与音色迁移等下游音乐生成任务十分重要。自动说话人确认(ASV)框架为我们提供了用于确认未见过说话人身份的架构与评估方法,这些可被重新用于学习和评估能够支持未见过乐器的乐器声音嵌入空间。借鉴最先进的 ASV 技术,我们构建了一个使用 SincNet 前端、ResNet 架构和角 softmax 目标函数的乐器识别模型。在 NSynth 和 RWC 数据集上的实验表明了该模型在未见乐器等错误率(EER)方面的有效性,消融研究显示了数据增强与角 softmax 目标的重要性。实验还显示了使用基于 CQT 的滤波器组初始化 SincNet 优于基于 Mel 滤波器组初始化。进一步通过 t-SNE 可视化与探测分类任务对所学嵌入空间进行补充分析,表明将乐器族标签作为多任务学习目标有助于正则化嵌入空间并引入有用结构,且嵌入中包含如演奏风格等训练时未包含的有意义信息。

关键词

引用

@article{arxiv.2107.11506,
  title  = {Use of speaker recognition approaches for learning and evaluating embedding representations of musical instrument sounds},
  author = {Xuan Shi and Erica Cooper and Junichi Yamagishi},
  journal= {arXiv preprint arXiv:2107.11506},
  year   = {2021}
}

备注

Accepted by the IEEE/ACM Transactions on Audio, Speech, and Language Processing