中文

利用神经自回归模型实现高效且实时的钢琴转录

音频与语音处理 2024-04-11 v1 机器学习 声音

摘要

近年来,神经网络设计的进步和大规模标注数据集的可用性使得钢琴转录模型的准确性得到了显著提升。然而,先前的大多数工作侧重于高性能的离线转录,忽略了对模型大小的刻意考量。本工作的目标是在确保高性能和轻量化的同时,实现钢琴转录的实时推理。为此,我们提出了卷积循环神经网络的新颖架构,重新设计了现有的自回归钢琴转录模型。首先,我们通过在 CNN 模块中添加频率条件化的 FiLM 层来扩展声学模块,以在频率轴上自适应调整卷积滤波器。其次,我们使用专注于音符内音符状态转换的音高维度 LSTM 来改进音符状态序列建模。此外,我们用增强的递归上下文扩充了自回归连接。利用这些组件,我们提出了两种类型的模型:一种追求高性能,另一种追求高紧凑性。通过大量实验,我们表明所提出的模型在 MAESTRO 数据集上的音符准确率方面与 SOTA 模型相当。我们还通过逐步精简架构来调查有效模型大小和实时推理延迟。最后,我们在未见过的钢琴数据集上进行了跨数据评估,并从音符长度和音高范围的角度进行了深入分析,以阐明所提组件的效果。

关键词

引用

@article{arxiv.2404.06818,
  title  = {Towards Efficient and Real-Time Piano Transcription Using Neural Autoregressive Models},
  author = {Taegyun Kwon and Dasaem Jeong and Juhan Nam},
  journal= {arXiv preprint arXiv:2404.06818},
  year   = {2024}
}

备注

11 pages, 8 figures, preprint