中文

语音领域中对 LLM 的评估往往存在缺陷:语音识别大语言模型中的测试集污染

音频与语音处理 2025-06-06 v2 计算与语言

摘要

近期的研究表明,与现有系统相比,大语言模型能够提升语音任务的性能。为了支持其主张,这些研究经常引用在 LibriSpeech 和 Common Voice 上的结果。然而,本研究发现,LibriSpeech 和 Common Voice 评估集中的大量内容出现在公开的 LLM 预训练语料库中。这使从这两个数据集中得出的结论的可靠性受到质疑。为了衡量污染的影响,本文比较了在有污染和无污染数据下训练的 LLM。受污染的 LLM 更有可能生成其在训练期间见过的测试句子。随后,比较了基于 LLM 的语音识别器。结果表明,如果 LLM 受到污染,识别器的错误率差异仅表现为微小的变化,但会为 LLM 训练期间见过的转录文本分配显著更高的概率。结果表明,LLM 的输出可能会被极少量的数据污染所偏置,这凸显了使用留出数据评估基于 LLM 的语音系统的重要性。

关键词

引用

@article{arxiv.2505.22251,
  title  = {Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition},
  author = {Yuan Tseng and Titouan Parcollet and Rogier van Dalen and Shucong Zhang and Sourav Bhattacharya},
  journal= {arXiv preprint arXiv:2505.22251},
  year   = {2025}
}