中文

ChordFormer:一种用于大词表音频和弦识别的Conformer架构

声音 2025-02-18 v1 人工智能 计算机视觉与模式识别 信息检索 机器学习

摘要

由于和弦在音乐分析中具有抽象和描述性的本质,和弦识别成为音乐信息检索中的一项关键任务。虽然音频和弦识别系统在小词表(例如,大/小三和弦)上已取得了显著的准确率,但大词表和弦识别仍是一个具有挑战性的问题。这种复杂性还源于和弦固有的长尾分布,即罕见的和弦类型在大多数数据集中代表性不足,导致训练样本不充分。有效的和弦识别需要利用音频序列的上下文信息,然而现有模型,如卷积神经网络、双向长短期记忆网络和双向Transformer的组合,在捕获长期依赖方面存在局限性,并且在大词表和弦识别任务上表现欠佳。本工作提出了ChordFormer,一种新颖的基于Conformer的架构,旨在解决大词表的结构化和弦识别(例如,三和弦、低音、七和弦)。ChordFormer利用将卷积神经网络与Transformer集成的Conformer块,从而使模型能够有效捕获局部模式和全局依赖。通过重加权损失函数和结构化和弦表示解决类别不平衡等挑战,ChordFormer优于SOTA模型,在大词表和弦数据集上帧级准确率提高了2%,类级准确率提高了6%。此外,ChordFormer在处理类别不平衡方面表现出色,在各种和弦类型间提供稳健且均衡的识别。该方法弥合了理论音乐知识与实际应用之间的差距,推动了大词表和弦识别领域的发展。

关键词

引用

@article{arxiv.2502.11840,
  title  = {ChordFormer: A Conformer-Based Architecture for Large-Vocabulary Audio Chord Recognition},
  author = {Muhammad Waseem Akram and Stefano Dettori and Valentina Colla and Giorgio Carlo Buttazzo},
  journal= {arXiv preprint arXiv:2502.11840},
  year   = {2025}
}

备注

13 pages, 4 figures