基于大语言模型的中文语音识别错误纠正中的拼音正则化
计算与语言
2024-09-25 v1 声音
音频与语音处理
摘要
最近的研究表明,大语言模型 (LLM) 在自动语音识别 (ASR) 的错误纠正中效果显著。然而, much of the research focuses on the English language. 本文将注意力转向中文。首先,我们构建了一个专用于中文 ASR 错误纠正的 specialized benchmark 数据集,包含 72.4 万个假设-转录对,称为中文假设乐园数据集 (ChineseHP),涵盖广泛场景并具有显著挑战性。随后,我们使用该数据集对直接提示和 fine-tuning 预训练 LLM 进行初步评估。此外,我们提出一种简单的拼音正则化方法,其涉及将拼音直接从文本假设中转录。实验结果表明,与不采用正则化的模型相比,拼音正则化持续显著提升了 LLM 的错误纠正能力。该数据集已在网站上提供。
引用
@article{arxiv.2407.01909,
title = {Pinyin Regularization in Error Correction for Chinese Speech Recognition with Large Language Models},
author = {Zhiyuan Tang and Dong Wang and Shen Huang and Shidong Shang},
journal= {arXiv preprint arXiv:2407.01909},
year = {2024}
}
备注
Interspeech 2024