PSP:面向印度语文本转语音的可解释逐维度口音基准
摘要
标准文本转语音 (TTS) 评估衡量可懂度 (WER, CER) 和整体自然度 (MOS, UTMOS),但不量化口音。一个合成器可能在所有这四项上得分很高,但在目标语言中具有音位区分性的特征上听起来仍像非母语。对于印度语系,这些特征包括卷舌发音、送气、元音长度以及泰米尔语卷舌近音 (字母 zha)。我们提出了 PSP (Phoneme Substitution Profile,音素替换轮廓),一个面向印度语 TTS 的可解释、逐音系维度口音基准。PSP 将口音分解为六个互补维度:卷舌坍塌率 (RR)、送气保真度 (AF)、元音长度保真度 (LF)、泰米尔语 zha 保真度 (ZF)、Fréchet 音频距离 (FAD) 和韵律特征散度 (PSD)。前四个维度通过强制对齐加上基于 Wav2Vec2-XLS-R 第9层嵌入的母语者中心声学探针来测量;后两个是语料库级别的分布距离。在本 v1 版本中,我们在印地语、泰卢固语和泰米尔语试点集上对四个商业和开源系统 (ElevenLabs v3, Cartesia Sonic-3, Sarvam Bulbul, Indic Parler-TTS) 进行基准测试,第五个系统 (Praxy Voice) 包含在所有三种语言中,外加一个泰卢固语的 R5->R6 案例研究。三个发现:(i) 卷舌坍塌率随音系难度印地语 < 泰卢固语 < 泰米尔语 (~1%, ~40%, ~68%) 单调增长;(ii) PSP 排序与 WER 排序不一致——商业 WER 领先者在卷舌或韵律保真度上并不一致领先;(iii) 没有任何单一系统在所有六个维度上都是帕累托最优的。我们发布了母语参考中心点 (每种语言500个片段)、用于 FAD 的1000个片段嵌入、用于 PSD 的500个片段韵律特征矩阵、每种语言300个话语的黄金集、MIT 许可下的评分代码以及 CC-BY 下的中心点。正式的 MOS 相关性推迟至 v2;v1 报告了五个内部一致性信号外加一个母语音频健全性检查。
引用
@article{arxiv.2604.25476,
title = {PSP: An Interpretable Per-Dimension Accent Benchmark for Indic Text-to-Speech},
author = {Venkata Pushpak Teja Menta},
journal= {arXiv preprint arXiv:2604.25476},
year = {2026}
}
备注
8 pages, 7 tables. Companion paper to Praxy Voice (arXiv:submission id - 7506231). Code: https://github.com/praxelhq/psp-eval; Centroids: https://huggingface.co/datasets/Praxel/psp-native-centroids