SHEET:面向多用途开源语音人类评估估量工具包
声音
2025-05-22 v1 音频与语音处理
摘要
我们介绍SHEET,一款旨在加速主观语音质量评估(SSQA)研究的多功能开源工具包。SHEET全称Speech Human Evaluation Estimation Toolkit,专注于数据驱动的深度神经网络模型,这些模型在训练时用于预测语音样本的人工标注质量分数。SHEET提供全面的训练和评估脚本、多数据集和多模型支持,以及通过Torch Hub和HuggingFace Spaces可访问的预训练模型。为展示其功能,我们对SSL-MOS——一种广泛用于近期科学论文中的语音自监督学习(SSL)基SSQA模型进行了重新评估。实验在名为BVCC和NISQA的两个代表性SSQA数据集上进行,我们识别出最佳语音SSL模型,其性能超过了原始SSL-MOS实现,与最先进的方法相当。
引用
@article{arxiv.2505.15061,
title = {SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit},
author = {Wen-Chin Huang and Erica Cooper and Tomoki Toda},
journal= {arXiv preprint arXiv:2505.15061},
year = {2025}
}
备注
INTERSPEECH 2025. Codebase: https://github.com/unilight/sheet