中文

超越ROUGE:基于N-gram子空间特征的LLM幻觉检测

计算与语言 2025-09-09 v1 机器学习

摘要

大语言模型(LLM)在涵盖自然语言的广泛任务中展现出强大能力,但幻觉问题仍是制约其可信度的根本性挑战,限制了其生成一致、真实信息的能力。检测幻觉迅速成为重要议题,诸如不确定性估计、LLM评判器、检索增强生成(RAG)和一致性检查等方法备受推崇。许多方法依赖基础指标(如ROUGE、BERTScore或Perplexity),但这些指标往往缺乏必要的语义深度以有效检测幻觉。本文受ROUGE启发,提出一种新方法,通过从LLM生成文本构建N-gram频率张量。该张量通过编码共现模式捕获更丰富的语义结构,实现对事实性与幻觉内容的更好区分。我们通过将张量分解方法应用于提取每个模式的奇异值,并将其作为输入特征训练多层感知机(MLP)二分类器用于幻觉检测。该方法在HaluEval数据集上进行评估,相较于传统基线显著优于,同时在SOTA LLM评判器方面表现具竞争力。

关键词

引用

@article{arxiv.2509.05360,
  title  = {Beyond ROUGE: N-Gram Subspace Features for LLM Hallucination Detection},
  author = {Jerry Li and Evangelos Papalexakis},
  journal= {arXiv preprint arXiv:2509.05360},
  year   = {2025}
}