通过分析无参考度量的注意力实现词级 ASR 质量估计以进行高效语料采样与后编辑
计算与语言
2024-02-06 v2 声音
音频与语音处理
摘要
在自动语音识别(ASR)领域,探索不仅具备高准确率且能在其决策过程中提供透明度的模型至关重要。本文引入并评估了质量估计(QE)度量的潜力,将其作为增强 ASR 系统中可解释人工智能(XAI)的新颖工具。通过实验与分析,本文探索了 NoRefER(无参考错误率,No Reference Error Rate)度量在识别词级错误方面的能力,以协助后编辑人员改进 ASR 假设。研究还扩展至 NoRefER 在语料构建过程中的效用,证明了其在通过富有洞察力的标注来增强数据集方面的有效性。本文考察了 NoRefER 的诊断特性,揭示了其提供关于模型行为和决策模式有价值见解的能力。这已被证明有利于在后编辑工作流中确定假设的优先级以及微调 ASR 模型。研究结果表明,NoRefER 不仅是一个错误检测工具,更是增强 ASR 系统透明度、效率和有效性的综合框架。为确保结果的可复现性,本研究的所有源代码均已公开提供。
引用
@article{arxiv.2401.11268,
title = {Word-Level ASR Quality Estimation for Efficient Corpus Sampling and Post-Editing through Analyzing Attentions of a Reference-Free Metric},
author = {Golara Javadi and Kamer Ali Yuksel and Yunsu Kim and Thiago Castro Ferreira and Mohamed Al-Badrashiny},
journal= {arXiv preprint arXiv:2401.11268},
year = {2024}
}