面向时间对齐音乐记谱生成的音符级唱和旋律转位
声音
2025-02-19 v1 音频与语音处理
信号处理
摘要
自动音乐转位将音频录音转换为符号表示,促进音乐分析、检索和生成。一个音符在音频域中由音高、起始和结束时间特征,而在音乐记谱域中则由音高和时值定义。包含时间信息的音高和时值的时间对齐记谱,使部分记谱能够与相应的音频部分匹配,从而支持各种应用。在本文中,我们考虑扩展的传统音符级转位任务,即通过提取额外的时值来识别起始、结束和音高,从而从音频输入生成时间对齐记谱。为解决这一新挑战,我们提出了一个集成音符时值、音高和时间信息识别的端到端框架。该方法避免了多阶段方法中固有的误差累积,并通过相互强化来提高准确性。我们的框架针对该任务采用了特定的标记表示,融入了时值信息。此外,我们引入一种伪标记技术,以解决已标注时值数据稀缺的问题。该技术从现有数据集中生成近似时值标签。实验结果表明,与现有最新方法相比,所提模型在音符级转位任务中表现出优越性能。我们还引入了新的评估指标,以评估时间和时值方面的表现,证明该模型的鲁棒性。此外,通过可视化的音乐记谱进行的定性评估确认了该模型在捕获时值方面的有效性。
引用
@article{arxiv.2502.12438,
title = {Note-Level Singing Melody Transcription for Time-Aligned Musical Score Generation},
author = {Leekyung Kim and Sungwook Jeon and Wan Heo and Jonghun Park},
journal= {arXiv preprint arXiv:2502.12438},
year = {2025}
}
备注
Accepted by IEEE Transactions on Audio, Speech and Language Processing(TASLP)