中文

Semantic-WER:用于评估 ASR 转写文本终端可用性的统一指标

计算与语言 2021-10-19 v2 声音 音频与语音处理

摘要

近来,有监督、半监督与自监督深度学习算法的进展显示出自动语音识别(ASR)系统性能的显著提升。最先进的系统已实现低于 5% 的词错误率(WER)。然而,过去研究者曾论证 WER 指标不适用于评估面向口语语言理解(SLU)与信息检索等下游任务的 ASR 系统。原因在于 WER 仅在表层工作,不包含任何句法与语义知识。本工作提出 Semantic-WER(SWER),一种用于通用下游应用评估 ASR 转写文本的指标。SWER 可针对任意下游任务轻松定制。

关键词

引用

@article{arxiv.2106.02016,
  title  = {Semantic-WER: A Unified Metric for the Evaluation of ASR Transcript for End Usability},
  author = {Somnath Roy},
  journal= {arXiv preprint arXiv:2106.02016},
  year   = {2021}
}