中文

基于卷积声学动机嵌入的歌手识别

音频与语音处理 2020-08-04 v1 声音

摘要

弗拉门戈演唱的特征在于音高不稳定、微音程装饰、大幅颤音范围以及高度的旋律可变性。这些音乐特征使得弗拉门戈歌手的自动识别成为一项困难的计算任务。本文提出一种基于声学动机嵌入的弗拉门戈歌手识别端到端流程。在所采取的方法中,直接由原始音频信号获取的基频被近似化。该近似降低了音频信号的高度可变性,并允许使用序列模式挖掘技术发现小的旋律模式,从而创建动机词典。随后利用若干声学特征,通过卷积架构提取变长动机的固定长度嵌入。我们在弗拉门戈歌手识别任务中测试了嵌入的质量,将我们的方法与先前的深度学习架构进行比较,并研究了动机模式与声学特征在识别任务中的影响。结果表明,动机模式通过最小化待学习信号的大小、丢弃在识别任务中不相关的信息,在识别弗拉门戈歌手中起关键作用。所提深度学习架构优于用于大规模音频分类问题的更稠密模型。

关键词

引用

@article{arxiv.2008.00198,
  title  = {Singer Identification Using Convolutional Acoustic Motif Embeddings},
  author = {Aitor Arronte Alvarez and Francisco Gomez-Martin},
  journal= {arXiv preprint arXiv:2008.00198},
  year   = {2020}
}

备注

5 pages