VocalParse:基于大型音频语言模型的统一可扩展歌声转录
声音
2026-05-07 v1 人工智能
摘要
高质量的歌声标注是现代歌声合成 (SVS) 系统的基础。然而,由于所需的大量劳动力和音乐专业知识,通过人工标注大规模获取这些标注是不现实的,这使得自动标注变得非常必要。尽管现有的自动转录系统具有实用性,但它们面临重大挑战:通常依赖复杂的多阶段流水线,难以恢复文本-音符对齐,并且对分布外 (OOD) 歌声数据的泛化能力差。为了缓解这些问题,我们提出了 VocalParse,一种基于大型音频语言模型 (LALM) 构建的统一歌声转录 (SVT) 模型。具体而言,我们的新颖贡献是引入了一种交错提示公式,联合建模歌词、旋律和词-音符对应关系,生成直接映射到结构化乐谱的序列。此外,我们提出了一种思维链 风格的提示策略,首先将歌词解码为语义支架,在保留交错生成结构优势的同时,显著缓解了上下文破坏问题。实验表明,VocalParse 在多个歌声数据集上实现了最先进的 SVT 性能。源代码和检查点可在 https://github.com/pymaster17/VocalParse 获取。
引用
@article{arxiv.2605.04613,
title = {VocalParse: Towards Unified and Scalable Singing Voice Transcription with Large Audio Language Models},
author = {Yukun Chen and Tianrui Wang and Zhaoxi Mu and Xinyu Yang and EngSiong Chng},
journal= {arXiv preprint arXiv:2605.04613},
year = {2026}
}