中文

STARS:面向歌唱转录、对齐与精细风格标注的统一框架

声音 2025-07-10 v1 音频与语音处理

摘要

近期在歌唱语音合成(SVS)方面的突破提升了对高质量标注数据集的需求,但手动标注仍昂贵且耗资源。现有自动歌唱标注(ASA)方法然而主要只解决标注管道的孤立方面。为解决这一根本性挑战,我们提出STARS,据我们所知是首个同时解决歌唱转录、对齐和精细风格标注的统一框架。我们的框架交付全面的多层次标注,包括:(1)精确的音素-音频对齐,(2)稳健的音符转录和时间局部化,(3)表达性声乐技巧识别,以及(4)包括情感和节奏在内的全局风格特征。该框架采用跨帧、词、音素、音符和句子水平的层次声学特征处理。该架构采用非自回归局部声学编码器,实现结构化的层次表示学习。实验验证表明,该框架在多个评估维度上相对于现有标注方法表现出优势。此外,针对SVS训练的应用表明,使用STARS标注的数据所训练的模型在感知自然度和精确风格控制方面显著提升。该工作不仅克服了歌唱数据集创建的关键可扩展性挑战,也开创了可控歌唱语音合成的新方法。音频样本可在 https://gwx314.github.io/stars-demo/ 查看。

关键词

引用

@article{arxiv.2507.06670,
  title  = {STARS: A Unified Framework for Singing Transcription, Alignment, and Refined Style Annotation},
  author = {Wenxiang Guo and Yu Zhang and Changhao Pan and Zhiyuan Zhu and Ruiqi Li and Zhetao Chen and Wenhao Xu and Fei Wu and Zhou Zhao},
  journal= {arXiv preprint arXiv:2507.06670},
  year   = {2025}
}

备注

9 pages, 2 figures