中文

HalluRAG 数据集:基于 LLM 内部状态检测 RAG 应用中的闭合域幻觉

计算与语言 2025-03-26 v2 机器学习

摘要

检测大语言模型 (LLM) 中的幻觉对于提高其可靠性和可信度至关重要。大多数研究聚焦于将幻觉视为与训练期间所见信息偏离的现象。然而,LLM 参数知识的不可见性使人们难以理解生成文本为何显得不 grounded:LLM 可能没有从大型且常常不可访问的数据集中获取必要的知识,或者信息可能在后续训练期间发生了变化或矛盾。我们的关注点是涉及训练中未使用的信息的幻觉,通过利用新近性确保该信息出现在截断日期之后。本研究通过在句子层面使用各种 LLM 的不同内部状态来检测这些幻觉。我们提出了 HalluRAG 数据集,用于训练分类器以检测这些幻觉。根据模型和量化方式,针对 HalluRAG 训练的 MLP 在检测幻觉方面可达最高 75% 的测试准确率,Mistral-7B-Instruct-v0.1 实现了最高的测试准确率。我们的结果表明,IAVs 能像 CEVs 一样有效地检测幻觉,揭示可回答和不可回答提示在编码方式上存在差异;为这些类别 developing 独立的分类器可提高准确率。然而,HalluRAG 显示出有限的可泛化性,呼吁在幻觉数据集中实现更广泛的多样性。

关键词

引用

@article{arxiv.2412.17056,
  title  = {The HalluRAG Dataset: Detecting Closed-Domain Hallucinations in RAG Applications Using an LLM's Internal States},
  author = {Fabian Ridder and Malte Schilling},
  journal= {arXiv preprint arXiv:2412.17056},
  year   = {2025}
}

备注

19 pages, 3 figures