基于生成式标注的ASR命名实体纠错
计算与语言
2025-10-27 v2 人工智能
摘要
端到端的自动语音识别系统常常会错误地转录领域特定的命名实体,导致下游任务出现灾难性错误。近年来提出了众多快速且轻量级的命名实体纠错(NEC)模型,但这些模型主要依赖语音水平的编辑距离算法,表现令人印象深刻。然而,当错误转录的单词形式与真实实体之间差异显著时,这些方法往往难以定位错误转录的单词,从而限制了其应用。我们提出一种新颖的 NEC 方法,利用语音声学特征检索候选实体。结合语音声学特征和候选实体,我们创造性地设计了一种生成式方法,用于为ASR转录中的实体错误进行标注,并将文本替换为正确的实体。该方法在词形差异较大的场景中效果显著。我们使用开源数据集和自构建的测试集进行测试。结果表明,Our NEC 方法能显著提高实体准确率。自构建的训练数据和测试集已公开发布于 github.com/L6-NLP/Generative-Annotation-NEC。
引用
@article{arxiv.2508.20700,
title = {Generative Annotation for ASR Named Entity Correction},
author = {Yuanchang Luo and Daimeng Wei and Shaojun Li and Hengchao Shang and Jiaxin Guo and Zongyao Li and Zhanglin Wu and Xiaoyu Chen and Zhiqiang Rao and Jinlong Yang and Hao Yang},
journal= {arXiv preprint arXiv:2508.20700},
year = {2025}
}
备注
12 pages, 7 figures, 7 tables, EMNLP 2025