Muskits-ESPnet:面向新范型的演唱语音合成综合工具包
声音
2024-10-14 v2 音频与语音处理
摘要
本研究提出了 Muskits-ESPnet,一种 versatile 工具包,通过应用预训练音频模型引入演唱语音合成(SVS)的新范型。具体而言,我们探索了来自 SSL 模型和音频编解码器的离散表示,具有显著的灵活性和智能性,支持多格式输入和可适应的数据处理工作流程,以适用于各种 SVS 模型。该工具包 features 自动音乐谱分辨错误检测和纠正,以及感知自动评估模块以模仿人类主观评估得分。Muskits-ESPnet 可在 \url{https://github.com/espnet/espnet} 获取。
引用
@article{arxiv.2409.07226,
title = {Muskits-ESPnet: A Comprehensive Toolkit for Singing Voice Synthesis in New Paradigm},
author = {Yuning Wu and Jiatong Shi and Yifeng Yu and Yuxun Tang and Tao Qian and Yueqian Lin and Jionghao Han and Xinyi Bai and Shinji Watanabe and Qin Jin},
journal= {arXiv preprint arXiv:2409.07226},
year = {2024}
}
备注
Accepted by ACMMM 2024 demo track