中文

基于卷积循环神经网络的和弦音高检测

声音 2022-02-07 v1 机器学习 多媒体 音频与语音处理

摘要

自动语音识别(ASR)研究近期的方向表明,将计算机视觉中图像识别任务的深度学习模型加以应用是有益的。由于自动音乐转录(AMT)在方法常依赖于将频谱图转换为符号事件序列(如词或音符)这一意义上与 ASR 表面相似,深度学习也应有益于 AMT。本工作中,我们概述了一个通过 ConvLSTM 将音频流转换为 MIDI 的在线和弦音高检测系统。我们的系统在 2007 年 MIREX 多音高(multi-F0)开发集上取得了最先进的结果,在巴松管、单簧管、长笛、圆号和双簧管合奏录音上 F-measure 达 83%,且无需任何音乐语言建模或乐器音色假设。

关键词

引用

@article{arxiv.2202.02115,
  title  = {Polyphonic pitch detection with convolutional recurrent neural networks},
  author = {Carl Thomé and Sven Ahlbäck},
  journal= {arXiv preprint arXiv:2202.02115},
  year   = {2022}
}

备注

MIREX 2017