中文

面向西班牙语TTS质量自动评估的数据集

声音 2025-07-03 v1 音频与语音处理

摘要

本工作致力于开发一个用于自动评估西班牙语文本转语音(TTS)系统的数据库,旨在提高自然度预测模型的准确性。该数据集包含来自52个不同TTS系统和人类语音的4,326个音频样本,据称是西班牙语中首个此类数据集。为标注音频,设计了基于ITU-T Rec. P.807标准的主观测试,并由92名参与者完成。进一步验证了所收集数据集的实用性,通过训练自动自然度预测系统来验证。我们探索了两种方法:微调最初用于英语训练的现有模型,以及在冻结的自监督语音模型上构建小型下游网络。我们的模型在五分制MOS尺度上实现0.8的平均绝对误差。进一步分析表明,所开发数据集的质量和多样性,以及其在西班牙语TTS研究中的潜在价值。

关键词

引用

@article{arxiv.2507.01805,
  title  = {A Dataset for Automatic Assessment of TTS Quality in Spanish},
  author = {Alejandro Sosa Welford and Leonardo Pepino},
  journal= {arXiv preprint arXiv:2507.01805},
  year   = {2025}
}

备注

5 pages, 2 figures. Accepted at Interspeech 2025