中文

声学精准 hesitation 标记是端到端直译转录系统的关键

计算与语言 2025-07-28 v2 声音 音频与语音处理

摘要

针对自动说话评估的逐字转录要求精准捕获语言不连贯现象,这对于后续的错误分析和反馈至关重要。然而,许多语音识别系统会忽略或泛化处理 hesitation 标记,导致重要的声学细节丢失。我们在 Speak & Improve 2025 语料库上对 Whisper 模型进行微调,使用低秩适配 (LoRA) 方法,无需额外的音频训练数据。我们比较了三种标注方案:移除 hesitation (Pure)、通用标签 (Rich) 以及通过 Gemini 2.0 Flash 从现有音频-文本对中推断的声学精准填充标记 (Extra)。我们的挑战系统在 Pure 方案下达到 6.47% 的 WER,在 Extra 方案下达到 5.81% 的 WER。挑战后实验表明,使用 Extra 方案对 Whisper Large V3 Turbo 进行微调,可获得 5.5% 的 WER,相较于 Pure 方案(6.2% WER)提升了 11.3% 的相对改进。这表明明确、真实的填充暂停标记显著提升了针对直译 L2 语音转录的 ASR 准确性。

关键词

引用

@article{arxiv.2506.04076,
  title  = {Acoustically Precise Hesitation Tagging Is Essential for End-to-End Verbatim Transcription Systems},
  author = {Jhen-Ke Lin and Hao-Chien Lu and Chung-Chun Wang and Hong-Yun Lin and Berlin Chen},
  journal= {arXiv preprint arXiv:2506.04076},
  year   = {2025}
}

备注

accepted to the ISCA SLaTE-2025 Workshop