中文

脱离转录,在分布迁移中发现:解构语音基础模型中的幻觉现象

计算与语言 2025-06-06 v2

摘要

大规模训练的语音基础模型(在模型和数据规模方面都非常庞大)具备稳健的系统能力,能够执行多种语音任务,包括自动语音识别(ASR)。这些模型跨越语言和领域边界,但有效衡量其性能仍具有挑战性。传统指标如词错误率(WER)和字符错误率(CER)常用于评估 ASR 性能,但往往无法反映关键情境下的转录质量,尤其是在检测人造输出时。这种现象称为幻觉(hallucination),在医疗、法律和航空等高风险领域尤为棘手,错误可能造成严重后果。本文针对这一空白进行了调查,探讨了分布迁移、模型规模和模型架构对幻觉错误率(HER)——我们提出的用于量化幻觉的指标——的影响。我们对 20 多款 ASR 模型的分析揭示了 \numinsights~关键见解:(1)高 WER 可能掩盖低幻觉率,而低 WER 可能隐藏危险的幻觉。(2)合成噪声(包括对抗性噪声和常见扰动,如白噪声、音调移动和时间拉伸)会增加 HER。(3)分布迁移与 HER 高度相关(α=0.91\alpha = 0.91)。我们的发现凸显了在评估 ASR 模型性能时,尤其是在高风险领域,必须将 HER 纳入传统指标如 WER 的评估体系之中。

关键词

引用

@article{arxiv.2502.12414,
  title  = {Lost in Transcription, Found in Distribution Shift: Demystifying Hallucination in Speech Foundation Models},
  author = {Hanin Atwany and Abdul Waheed and Rita Singh and Monojit Choudhury and Bhiksha Raj},
  journal= {arXiv preprint arXiv:2502.12414},
  year   = {2025}
}

备注

ACL2025 camera-ready