中文

Indic ASR 的诊断评估与丰富转录模型:SCRIBE

计算与语言 2026-05-21 v1 人工智能

摘要

自动语音识别只有在纠错成本低于手动输入时才会取代输入,这一阈值由错误类型决定,而非错误次数:纠正误识别的领域术语的成本远高于插入逗号。词错误率 (WER) 在两个方面都有缺陷: 它将不同的错误类别折叠为单个标量, 且在结构上惩罚屈�律语言, 其中有效的 sandhi 合并会导致分数上升。我们引入 SCRIBE, 一个诊断框架, 通过对词汇注入实现对词汇、标点、 numeral 和领域实体率的分类错误分解, 并通过容忍 sandhi 的对齐方式。人类验证确认 SCRIBE 在 WER 不符合专家判断的情形下能够对齐。我们发布 SCRIBE, 一个大语言模型策展管道, 基准数据集, 以及面向印地语、Malayalam 和 Kannada 的开源重型转录模型。

关键词

引用

@article{arxiv.2605.20712,
  title  = {SCRIBE: Diagnostic Evaluation and Rich Transcription Models for Indic ASR},
  author = {Kavya Manohar and Arghya Bhattacharya and Kush Juvekar and Kumarmanas Nethil},
  journal= {arXiv preprint arXiv:2605.20712},
  year   = {2026}
}

备注

Submitted to Interspeech 2026