中文

神经自动语音识别中的幻觉:识别错误与幻觉模型

计算与语言 2024-01-04 v1 声音 音频与语音处理

摘要

幻觉是深度神经网络产生的一种输出错误。虽然在自然语言处理中已有研究,但在自动语音识别中此前尚未被探讨。在此,我们将ASR中的幻觉定义为模型生成的转录,这些转录与源话语在语义上无关,但仍然流畅且连贯。幻觉与模型可能产生的自然语言输出的相似性造成了欺骗的危险,并影响了系统的可信度。我们表明,常用的指标(如词错误率)无法区分幻觉模型和非幻觉模型。为了解决这个问题,我们提出了一种基于扰动的方法,用于在测试时评估自动语音识别(ASR)模型对幻觉的敏感性,该方法不需要访问训练数据集。我们证明,该方法有助于区分具有相似基线词错误率的幻觉模型和非幻觉模型。我们进一步探讨了ASR错误类型与数据集噪声类型之间的关系,以确定哪些类型的噪声最有可能产生幻觉输出。我们设计了一个框架,通过分析幻觉与真实标签的语义联系及其流畅性来识别幻觉。最后,我们发现了如何通过向话语注入随机噪声来诱发幻觉。

关键词

引用

@article{arxiv.2401.01572,
  title  = {Hallucinations in Neural Automatic Speech Recognition: Identifying Errors and Hallucinatory Models},
  author = {Rita Frieske and Bertram E. Shi},
  journal= {arXiv preprint arXiv:2401.01572},
  year   = {2024}
}