中文

基于通用偏好分数的成对语音质量评估

声音 2025-06-03 v1 音频与语音处理

摘要

为了比较两个语音生成系统的性能,最有效的方法之一是估计其生成语音之间的偏好分数。本文提出了一种新颖的基于通用偏好分数的成对语音质量评估(UPPSQA)模型,旨在预测成对语音样本之间的偏好分数,以确定哪一个具有更好的质量。该模型首先分别预测两个语音样本的绝对平均意见分(MOS),然后使用偏好函数将它们聚合为相对偏好分数。为了解决偏好数据稀缺的问题,我们还基于 MOS 数据集构建了一个新的成对语音数据集用于实验。实验结果证实,无论是在具有不同数据类型和标签条件的训练场景中,还是在域内和域外测试场景中,UPP-SQA 的预测准确率均优于基线模型,证明了其通用性。

关键词

引用

@article{arxiv.2506.01455,
  title  = {Universal Preference-Score-based Pairwise Speech Quality Assessment},
  author = {Yu-Fei Shi and Yang Ai and Zhen-Hua Ling},
  journal= {arXiv preprint arXiv:2506.01455},
  year   = {2025}
}