人声打击乐自动转录中的用户特定自适应
声音
2018-11-07 v1 音频与语音处理
摘要
本工作的目标是开发一款应用,使音乐制作人在数字音频工作站(DAWs)中创作时能够用其声音来生成鼓点模式。本文提出了一种易于使用且面向用户的系统,能够自动转录打击乐声音的人声化,称为LVT——Live Vocalised Transcription。LVT开发为Max for Live设备,遵循用于鼓转录的“分段与分类”方法,并包含三个模块:i) 用于按时间分割事件的起音检测器;ii) 从音频内容中提取相关特征的模块;iii) 实现k近邻(kNN)算法以分类人声化鼓音色的机器学习组件。由于不同用户对同一鼓声的人声化差异很大,提出了一种针对人声化转录的用户特定方法。在此视角下,给定终端用户在将其所需模式输入DAW之前,先用其自身的人声化对每个鼓声训练算法。用户自适应通过一个新的Max外部对象实现,该对象采用顺序前向选择(SFS)来为给定的一组输入鼓声选择最相关特征。
引用
@article{arxiv.1811.02406,
title = {User Specific Adaptation in Automatic Transcription of Vocalised Percussion},
author = {António Ramires and Rui Penha and Matthew E. P. Davies},
journal= {arXiv preprint arXiv:1811.02406},
year = {2018}
}