SingMOS:一个用于MOS预测的广泛开源歌声数据集
声音
2024-06-21 v2 音频与语音处理
摘要
在语音生成任务中,人类主观评分(通常称为意见分数)被认为是语音质量评估的“黄金标准”,其中平均意见分数(MOS)是主要的评估指标。由于人工标注成本高昂,语音领域出现了多个MOS预测系统,并展现出良好的性能。这些MOS预测模型使用以往语音相关挑战赛的标注数据进行训练。然而,与语音领域相比,歌声领域面临数据稀缺和更严格的版权保护问题,导致缺乏高质量的、带有MOS标注的歌声数据集。为解决这一问题,我们提出了SingMOS,一个高质量且多样化的歌声MOS数据集,涵盖了多个中文和日文数据集。这些合成的歌声是通过歌声合成、转换或再合成任务中的最先进模型生成的,并由专业标注员与真实歌声一起进行评分。数据分析证明了我们数据集的多样性和可靠性。此外,我们在SingMOS上进行了进一步探索,为歌声MOS预测提供了见解,并为SingMOS的持续扩展提供了指导。
引用
@article{arxiv.2406.10911,
title = {SingMOS: An extensive Open-Source Singing Voice Dataset for MOS Prediction},
author = {Yuxun Tang and Jiatong Shi and Yuning Wu and Qin Jin},
journal= {arXiv preprint arXiv:2406.10911},
year = {2024}
}