Semantic-WER:用于评估 ASR 转写文本终端可用性的统一指标
计算与语言
2021-10-19 v2 声音
音频与语音处理
摘要
近来,有监督、半监督与自监督深度学习算法的进展显示出自动语音识别(ASR)系统性能的显著提升。最先进的系统已实现低于 5% 的词错误率(WER)。然而,过去研究者曾论证 WER 指标不适用于评估面向口语语言理解(SLU)与信息检索等下游任务的 ASR 系统。原因在于 WER 仅在表层工作,不包含任何句法与语义知识。本工作提出 Semantic-WER(SWER),一种用于通用下游应用评估 ASR 转写文本的指标。SWER 可针对任意下游任务轻松定制。
引用
@article{arxiv.2106.02016,
title = {Semantic-WER: A Unified Metric for the Evaluation of ASR Transcript for End Usability},
author = {Somnath Roy},
journal= {arXiv preprint arXiv:2106.02016},
year = {2021}
}