中文

面向高效精准语音识别后编辑的上下文增强细粒度编辑表示

计算与语言 2025-09-19 v1 声音 音频与语音处理

摘要

尽管 ASR 技术已在产业中大规模采用且服务于广大人群,但 ASR 系统常常存在错误,需要编辑人员进行后编辑以提升文本质量。虽然大语言模型 (LLM) 是强大的后编辑工具,但基线的全改写模型因常在重复生成冗余文本而存在推理效率问题。已有紧凑编辑表示方法但往往缺乏足够的效能和上下文以实现最佳准确性。本文引入 CEGER (Context-Enhanced Granular Edit Representation),一种为高精度、高效的语音识别后编辑而生成的紧凑编辑表示。CEGER 允许 LLM 生成一系列结构化的、细粒度的、具上下文丰富性的命令,以修改原始 ASR 输出。独立的扩展模块基于这些命令确定性地重构校正后的文本。我们在 LibriSpeech 数据集上进行了大规模实验,CEGER 实现了最先进的准确性,在全改写和先前紧凑表示方法中实现了最低的词错误率 (WER)。

关键词

引用

@article{arxiv.2509.14263,
  title  = {Context-Enhanced Granular Edit Representation for Efficient and Accurate ASR Post-editing},
  author = {Luan Vejsiu and Qianyu Zheng and Haoxuan Chen and Yizhou Han},
  journal= {arXiv preprint arXiv:2509.14263},
  year   = {2025}
}