中文

语音基础模型的幻觉基准测试

计算与语言 2025-10-21 v1 声音 音频与语音处理

摘要

自动语音识别 (ASR) 系统中的幻觉现象指的是神经网络 ASR 模型产生的、与底层声学输入 (即语音信号) 完全无关的流畅且连贯的转录文本。虽然类似于传统解码错误,可能影响下游应用的可用性,但幻觉现象因其保留了语法和语义上合理的结构而更为严重。这种表面的连贯性可能会误导后续处理阶段并在医疗、法律等关键领域引发严重风险。传统评估指标主要基于错误导向的度量,无法区分语音不准和幻觉现象。因此,迫切需要新的评估框架来有效识别和评估模型生成幻觉内容的倾向。为此,我们引入了 SHALLOW,这是首个系统性地对 ASR 中的幻觉现象进行分类和量化的基准框架,沿用四个互补轴向:词汇、语音、形态和语义。我们在每个类别中定义针对性的度量,以产生可解释的模型行为轮廓。通过在各种架构和语音领域进行评估,我们发现 SHALLOW 指标在识别质量较高时 (即 WER 较低) 与词错误率 (WER) 高度相关,但随着 WER 增加,相关性显著减弱。因此,SHALLOW 在捕捉 WER 在退化和挑战性条件下无法区分的细粒度错误模式方面发挥了作用。我们的框架支持对模型弱点的特定诊断,并为模型改进提供反馈,超越单一综合错误率所能提供的。

关键词

引用

@article{arxiv.2510.16567,
  title  = {Hallucination Benchmark for Speech Foundation Models},
  author = {Alkis Koudounas and Moreno La Quatra and Manuel Giollo and Sabato Marco Siniscalchi and Elena Baralis},
  journal= {arXiv preprint arXiv:2510.16567},
  year   = {2025}
}

备注

Under Review