文本到语音评估的神经网络
计算与语言
2026-04-13 v1 人工智能
声音
音频与语音处理
摘要
确保文本到语音(TTS)系统在规模化情况下交付人类感知质量是现代语音技术的核心挑战。人类主观评估协议如平均意见分数(MOS)和双侧比较(SBS)仍是事实上的金标准,但成本高昂、缓慢,且对普遍评估者偏见敏感。本研究通过构建一套新型神经模型来解决这些障碍,旨在近似专家判断,涵盖相对(SBS)和绝对(MOS)场景。对于相对评估,我们提出NeuralSBS——一个基于HuBERT的模型,在SOMOS数据集上实现73.7%的准确率。对于绝对评估,我们对MOSNet进行增强,采用自定义序列长度批处理,并引入WhisperBert——一个结合Whisper音频特征和BERT文本嵌入的多模态堆叠集成模型。我们最好的MOS模型实现约0.40的均方根误差(RMSE),显著优于人类评估者基线的0.62。此外,我们的消融研究揭示,简单地通过跨注意力融合文本会降低性能,凸显基于集成堆叠而非直接潜在融合的有效性。我们另外报告了SpeechLM-based架构和零样本LLM评估器(Qwen2-Audio、Gemini 2.5 flash preview)的负面结果,强化了专门的指标学习框架的必要性。
引用
@article{arxiv.2604.08562,
title = {Neural networks for Text-to-Speech evaluation},
author = {Ilya Trofimenko and David Kocharyan and Aleksandr Zaitsev and Pavel Repnikov and Mark Levin and Nikita Shevtsov},
journal= {arXiv preprint arXiv:2604.08562},
year = {2026}
}