中文

面向非三和弦的基于事件的序列建模方法以减少过度分割

声音 2026-04-28 v1 音频与语音处理

摘要

自动和弦识别(ACR)从音频录音中提取时间对齐的和弦标签。尽管近期取得了进展,ACR 仍在处理过度分割、数据稀缺和不平衡问题,尤其是识别复杂和弦如非三和弦,这些和弦在现有数据集中不受欢迎。为此,我们将 ACR 重构为基于段落的序列到序列预测任务,其中和弦序列以自回归方式预测而非逐帧预测。这种设计通过仅在段落边界检测和弦变化来缓解过度分割。我们进一步引入两种类型的 token 表示和编码器预训练方法,这两种方法专为时间对齐和弦建模而设计。实验结果表明,我们的模型在和弦识别和分割方面均取得了改进,尤其是对复杂且不常见的和弦类型实现了显著提升。这些发现表明,基于段落的序列建模、结构化标记化和表示学习对于推动和弦识别系统具有有效性。

关键词

引用

@article{arxiv.2604.24386,
  title  = {An event-based sequence modeling approach to recognizing non-triad chords with oversegmentation minimization},
  author = {Leekyung Kim and Jonghun Park},
  journal= {arXiv preprint arXiv:2604.24386},
  year   = {2026}
}

备注

accepted to ICASSP 2026