中文

SALF-MOS:用于 MOS 预测的说话人无关下采样潜在特征

声音 2025-06-04 v1 人工智能 机器学习

摘要

语音质量评估是选择文本到语音合成(TTS)或语音转换模型的关键过程。语音合成的评估可以使用客观指标或主观指标来完成。尽管有许多客观指标,如语音质量感知评估(PESQ)、感知客观听觉质量评估(POLQA)或短时客观可懂度(STOI),但它们在选择最佳模型时均不可行。另一方面,像平均意见分(MOS)这样的主观指标高度可靠,但需要大量人工工作且耗时。为了应对 MOS 评估中的问题,我们开发了一种新颖的模型,说话人无关潜在特征(SALF)-平均意见分(MOS),这是一个用于在 5 分制上预测 MOS 分数的小型、端到端、高度泛化且可扩展的模型。我们使用一系列卷积并将其堆叠以获取音频样本的潜在特征,从而基于均方误差(MSE)、线性一致性相关系数(LCC)、Spearman 等级相关系数(SRCC)和 Kendall 等级相关系数(KTAU)获得了最佳的最先进结果。

关键词

引用

@article{arxiv.2506.02082,
  title  = {SALF-MOS: Speaker Agnostic Latent Features Downsampled for MOS Prediction},
  author = {Saurabh Agrawal and Raj Gohil and Gopal Kumar Agrawal and Vikram C M and Kushal Verma},
  journal= {arXiv preprint arXiv:2506.02082},
  year   = {2025}
}