从 Discord 到 Harmony:基于分解共鸣的 ACE 训练以提高音频和弦估计
机器学习
2025-09-03 v1 人工智能
摘要
音频和弦估计 (ACE) 在音乐信息研究中占据核心位置,因其在音乐转录和分析方面的相关性而受到关注已有二十多年。尽管取得了显著进展,但该任务仍面临挑战,尤其是涉及和声内容的独特特征,导致现有系统的性能已达到瓶颈。这些挑战包括注释员主观性,其中不同注释员的不同解释导致不一致,以及和弦数据集中的类别不平衡,其中某些和弦类别的出现频率显著高于其他类别,给模型训练和评估带来困难。作为首要贡献,本文评估了和弦注释之间注释员间一致性,采用超越传统二元措施的度量标准。此外,我们提出一种共鸣感知距离度量标准,反映和声注释之间的感知相似性。我们的分析表明,基于共鸣的距离度量标准更有效地捕捉了注释之间在音乐上有意义的一致性。基于这些发现,我们引入一种新型 ACE conformer 模型,将共鸣概念整合到模型中,通过共鸣基于标签平滑实现。该模型还通过分别估计根音、低音和所有音符激活,来解决类别不平衡问题,从而实现从分解输出中重构和弦标签。
引用
@article{arxiv.2509.01587,
title = {One-Shot Clustering for Federated Learning Under Clustering-Agnostic Assumption},
author = {Maciej Krzysztof Zuziak and Roberto Pellungrini and Salvatore Rinzivillo},
journal= {arXiv preprint arXiv:2509.01587},
year = {2025}
}