中文

多语言语音识别中的脚本崩溃:无参考指标与 100 对基准

声音 2026-05-06 v2 音频与语音处理

摘要

词错误率 (WER) 是自动语音识别的主导指标,但无法检测系统性失效模式:即模型在错误书写系统中生成流畅输出。我们定义 Script Fidelity Rate (SFR),即假设字符位于目标脚本块中的比例,可无需参考转录实现。我们在十种语言(跨六种书写系统)和十个模型(七种 Whisper 规模、MMS-1B、SeamlessM4T-v2 和 Gemma 4 E2B)的 FLEURS 测试集上系统性测量脚本崩溃。评估 100 对 model-language pairs 时,21 (21%;95% Wilson 置信区间:14-30%) exhibits 脚本崩溃(SFR 小于 10%):其中 20 个涉及 Whisper,一个涉及 Gemma 4 E2B 在 Urdu 通用转录提示下。 在十语言 Gemma 4 探针中,script-aware 提示将 mean SFR 从 71.2% 提升至 97.7%,修复 Urdu 崩溃(6.5% 提升至 97.0%),并为 baseline SFR 低于 90% 的六种语言恢复 5.9 chrF on downstream NLLB 翻译。我们识别出四种崩溃模式:Latin 音标替代、阿拉伯文替代索马里文、Devanagari 替代孟加拉文/马来雅文,以及独特脚本 Latin 崩溃用于 Georgian。

关键词

引用

@article{arxiv.2604.08786,
  title  = {Script collapse in multilingual ASR: A reference-free metric and 100-pair benchmark},
  author = {Hanif Rahman},
  journal= {arXiv preprint arXiv:2604.08786},
  year   = {2026}
}