面向合成的鲁棒演唱声部转写
音频与语音处理
2024-06-04 v2 声音
摘要
音高级自动演唱声部转写(AST)将演唱录音转换为音符序列,为演唱声部合成(SVS)应用提供自动标注。然而现有 AST 方法在实际标注场景下难以实现高精度和鲁棒性。本文提出 ROSVOT,首个面向 SVS 的鲁棒 AST 模型,采用多尺度框架有效捕获粗粒度音符信息,确保细粒度帧级分割,并引入基于注意力的音高解码器实现可靠音高预测。我们还构建了完整的 SVS 标注与训练流水线,以实际场景测试该模型。实验结果表明,ROSVOT 在无论输入为干净还是噪声的条件下均实现了语音转写的拜占康式准确率。此外,在扩大自动标注数据集上训练的 SVS 模型超越基线,验证了其实际应用潜力。音频样本可在 https://rosvot.github.io 访问。
引用
@article{arxiv.2405.09940,
title = {Robust Singing Voice Transcription Serves Synthesis},
author = {Ruiqi Li and Yu Zhang and Yongqi Wang and Zhiqing Hong and Rongjie Huang and Zhou Zhao},
journal= {arXiv preprint arXiv:2405.09940},
year = {2024}
}
备注
ACL 2024