人声打击检索的学习模型:一项比较研究
声音
2021-10-19 v1 音频与语音处理
摘要
通过人声模仿打击乐是一种在现场传达节奏构思的自然且有效的工具。因此,使用人声打击自动检索鼓声可以帮助艺术家以舒适且快捷的方式制作鼓节奏原型,从而平滑创作工作流。在此,我们探索了执行此类查询的不同策略,同时使用了传统机器学习算法和近期的深度学习技术。通过将性能指标输入网格搜索算法,仔细选择了相关模型的主要超参数。我们还研究了几种音频数据增强技术,这些技术有可能正则化深度学习模型并提高泛化能力。我们从有效性(分类准确率)、效率(计算速度)、稳定性(性能一致性)和可解释性(决策模式)方面比较了最终性能,并讨论了这些结果在设计成功的人声打击检索系统时的相关性。
引用
@article{arxiv.2110.09223,
title = {Learning Models for Query by Vocal Percussion: A Comparative Study},
author = {Alejandro Delgado and SkoT McDonald and Ning Xu and Charalampos Saitis and Mark Sandler},
journal= {arXiv preprint arXiv:2110.09223},
year = {2021}
}
备注
Published in proceedings of the International Computer Music Conference (ICMC) 2021