中文

PashtoTTS-Bench:面向低资源非拉丁脚本文本转语音的自动筛选

计算与语言 2026-05-27 v1 声音

摘要

面向低资源非拉丁脚本语言的文本转语音(TTS)评估,当仅依赖单轮 ASR 往返词错误率(WER)时,可能会失败。系统可能生成无音频、Speak 邻近语言、仅在 ASR 转录中保留目标脚本文本,或对原住民听众而言不自然。我们提出 INSV(Intelligibility, Naturalness, Script fidelity, and Verification)报告框架,将这些案例分离。本文报告 INSV-A,即自动筛选子集:合成完成度、ASR WER/CER、转录脚本忠实率和音频语言识别。本次发布未声称本土 MOS 和音素注释。我们将 INSV-A 实例化为 PashtoTTS-Bench,为 Pashto TTS 建立一个带时间戳的基准。2026 年 4 月至 5 月的运行评估了 Edge GulNawaz、Edge Latifa、OmniVoice clone、OmniVoice auto 以及 Urdu negative control 在 200 个 FLEURS 和 200 个过滤后的 Common Voice 24 提示上的表现。在独立的 omniASR_CTC_300M_v2 下,OmniVoice auto 的 WER 最低(FLEURS 24.1%,CV24 27.4%),随后是 Edge GulNawaz(32.8%,39.5%)、Edge Latifa(35.6%,47.7%)和 OmniVoice clone(45.4%,34.8%)。WER 低于自然语音基线反映干净的合成音频,不应被解读为优于本土语音。Whisper Large V3 在检查的 Pashto TTS 音频上返回 0.0% Pashto 标签,而 MMS-LID-4017 和 SpeechBrain VoxLingua107 将 Pashto 输出与 Urdu 对照。该发布提供了供应商元数据、逐句得分、LID 审计、失败日志以及添加系统的脚本。

关键词

引用

@article{arxiv.2605.26978,
  title  = {PashtoTTS-Bench: automated screening for low-resource non-Latin-script text-to-speech},
  author = {Hanif Rahman},
  journal= {arXiv preprint arXiv:2605.26978},
  year   = {2026}
}