给我看乐器:从混合音频中检索乐器
声音
2022-11-16 v1 机器学习
音频与语音处理
摘要
随着数字音乐制作成为主流,合适虚拟乐器的选择对音乐质量起着关键作用。为搜寻能发出所需声音的乐器样本或虚拟乐器,音乐制作人需用耳朵试听并比对收藏中每件乐器样本,耗时且低效。本文中将此任务称为乐器检索,并提出一种以参考音乐混合作为查询来检索所需乐器的方法。所提模型由单乐器编码器与多乐器编码器组成,均基于卷积神经网络。单乐器编码器经训练以分类单轨音频中所用乐器,我们取其倒数第二层激活作为乐器嵌入。多乐器编码器以单乐器编码器算得的乐器嵌入为目标嵌入集合,经训练估计多个乐器嵌入。为更泛化训练与更真实评估,我们还提出名为 Nlakh 的新数据集。实验结果表明,单乐器编码器能学习未见乐器音频信号到乐器嵌入空间的映射,多乐器编码器能从音乐混合中提取多个嵌入并成功检索所需乐器。实验所用代码与音频样本见:https://github.com/minju0821/musical_instrument_retrieval
引用
@article{arxiv.2211.07951,
title = {Show Me the Instruments: Musical Instrument Retrieval from Mixture Audio},
author = {Kyungsu Kim and Minju Park and Haesun Joung and Yunkee Chae and Yeongbeom Hong and Seonghyeon Go and Kyogu Lee},
journal= {arXiv preprint arXiv:2211.07951},
year = {2022}
}
备注
5 pages, 4 figures, submitted to ICASSP 2023