中文

基于深度学习多头注意力模型的乐器音色分类

声音 2021-07-14 v1 机器学习 音频与语音处理

摘要

本工作的目标是定义一个基于深度学习的模型,能够以尽可能少的参数识别不同的乐器音色。为此,我们使用了以不同力度演奏的古典管弦乐器,这些乐器属于少数几个乐器族,并在相同的音高范围内演奏音符。即便乐器以相同强度和相同音符演奏,也能评估按音色对乐器进行分类的能力。所采用的网络使用多头注意力机制,具有8个头,并在输出端使用稠密网络,以声音样本的对数梅尔幅度谱图作为输入。该网络可识别古典管弦乐队的20个乐器类别,总体F1_1值达到0.62。我们对注意力层的权重进行了分析,并给出了模型的混淆矩阵,从而能够评估所提架构区分音色的能力,并确定未来工作应关注的方面。

关键词

引用

@article{arxiv.2107.06231,
  title  = {Timbre Classification of Musical Instruments with a Deep Learning Multi-Head Attention-Based Model},
  author = {Carlos Hernandez-Olivan and Jose R. Beltran},
  journal= {arXiv preprint arXiv:2107.06231},
  year   = {2021}
}