中文

基于严格时延神经网络的卡尔纳特音阶识别系统

声音 2024-05-29 v1 人工智能 机器学习 多媒体 音频与语音处理

摘要

大规模基于机器学习的音阶识别在卡尔纳特音乐的计算方面仍是一个不成熟的问题。每个音阶包含许多独特且内在的旋律模式,可用于轻松地从其他音阶中识别它们。这些音阶还可用于对同一音阶内的歌曲进行聚类,以及识别其他 closely related 音阶中的歌曲。在这种情况下,对输入声音进行分析包括使用离散傅里叶变换和使用三角滤波器创建可能的音符的自定义箱体、提取特定音符存在或不存在的特征。使用神经网络的组合,包括1维卷积神经网络(通常称为时延神经网络)和长短期记忆网络(LSTM),后者是一种循环神经网络,来构建分类策略的模型主干。此外,为了帮助处理不同的音调(shruti)中的变化,实施一种基于长时间注意力的机制,以确定频率的相对变化而非绝对差异。这将为在不同音调中的音频剪辑提供更有意义的数据点进行训练。为了评估分类器的准确性,使用包含676个录音的 数据集进行评估。这些歌曲分布在音阶列表中。该程序的目标是能够有效且高效地标记更广泛范围内的音频剪辑,涵盖更多音调、音阶以及更多背景噪声。

关键词

引用

@article{arxiv.2405.16000,
  title  = {Carnatic Raga Identification System using Rigorous Time-Delay Neural Network},
  author = {Sanjay Natesan and Homayoon Beigi},
  journal= {arXiv preprint arXiv:2405.16000},
  year   = {2024}
}

备注

7 pages, 2 tables, 3 figures