CodecMOS-Accent:跨英语方言的人工无声编码与TTS语音的MOS基准
声音
2026-03-17 v1 音频与语音处理
摘要
我们提出CodecMOS-Accent数据集,一套用于评估神经音频编码(NAC)模型和在其上训练的大语言模型(LLM)基于文本的语音合成(TTS)模型的mean opinion score(MOS)基准,尤其关注非标准化语言如加重音的语音。数据集包含4000份NAC重合成和TTS样本,来自24个系统,涵盖32位说话者的10种英语方言。进行大规模主观测试,收集来自25位听众在三个维度上的19600条标注:自然度、说话者相似度和方言相似度。这一数据集不仅代表了近期语音合成系统的性能,还揭示了若干见解,包括说话者相似度与方言相似度之间的紧密关系、客观指标的预测能力,以及听众共享相同方言时存在的感知偏差。我们预计该数据集将推动更以人为中心的方式进行NAC和加重音TTS的评估研究。
引用
@article{arxiv.2603.14328,
title = {CodecMOS-Accent: A MOS Benchmark of Resynthesized and TTS Speech from Neural Codecs Across English Accents},
author = {Wen-Chin Huang and Nicholas Sanders and Erica Cooper},
journal= {arXiv preprint arXiv:2603.14328},
year = {2026}
}
备注
Preprint