法语语音识别系统基准测试:基于错误严重程度
计算与语言
2025-01-22 v1
摘要
自动语音识别(ASR)的转录错误通常使用与参考转录进行比较的指标进行评估,如词错误率(WER),该指标衡量与参考文本的拼写偏差,或基于语义得分的指标。然而,这些方法往往忽略了人类在解释转录错误时所能理解的内容。为解决这一局限性,本文提出了一种新的评估方法,将错误分为四个严重程度等级,进一步细分为子类型,基于客观语言标准、上下文模式以及以内容词为分析单位。将该指标应用于法语语言的10个最先进ASR系统基准测试中,涵盖HMM模型和端到端模型。我们的发现揭示了每个系统的优势与不足,识别了为用户提供最舒适阅读体验的系统。
引用
@article{arxiv.2501.10879,
title = {A Benchmark of French ASR Systems Based on Error Severity},
author = {Antoine Tholly and Jane Wottawa and Mickael Rouvier and Richard Dufour},
journal= {arXiv preprint arXiv:2501.10879},
year = {2025}
}
备注
To be published in COLING 2025 Proceedings