超越 WER:探究 Whisper 子词解码器在不同语言资源水平下的表现
计算与语言
2025-10-01 v1
摘要
尽管大型多语言自动语音识别 (ASR) 模型取得了显著的性能,但端到端流程的内部机制,特别是跨语言的公平性和有效性,仍未得到充分探索。本文对 Whisper 的多语言解码器进行了细粒度分析,考察其在不同资源水平的语言转录过程中的子词假设。我们的方法追踪了束搜索路径,捕获子词猜测及其相关概率。结果显示,资源较丰富的语言受益于正确 token 被排在首位的更高可能性、更高的置信度、更低的预测熵以及更多样化的替代候选。资源较匮乏的语言在这些指标上表现较差,但在子词使用中表现出独特的聚类模式,这在我们的 PCA 和 t-SNE 分析中有时受语言类型学影响。这种子词探测揭示了被聚合错误率掩盖的系统性解码差异,并指向了旨在改善语音技术不平衡发展的针对性干预措施。
引用
@article{arxiv.2509.25516,
title = {Beyond WER: Probing Whisper's Sub-token Decoder Across Diverse Language Resource Levels},
author = {Siyu Liang and Nicolas Ballier and Gina-Anne Levow and Richard Wright},
journal= {arXiv preprint arXiv:2509.25516},
year = {2025}
}