HalluScan:面向检测与缓解LLM幻觉的系统基准
计算与语言
2026-05-25 v2
摘要
大语言模型(LLMs)在 diverse natural language processing tasks 上展现出惊人的能力,但仍然容易产生幻觉——生成事实错误、不忠于提供的上下文,或与用户指令不一致的内容。我们提出HalluScan,一个综合性基准框架,系统评估幻觉检测与缓解,涵盖72种配置,涉及6种检测方法、4个开源模型家族和3个 diverse 领域。我们提出三个关键贡献:(1)HalluScore,一种新型复合指标,与人类专家判断的Pearson相关系数达r = 0.41;(2)自适应检测路由(Adaptive Detection Routing, ADR),一种智能路由算法实现2.0倍成本降低,仅有0.1%的AUROC下降;(3)系统性错误级联分解揭示了幻觉错误类型在不同领域间的显著差异。我们的实验显示,NLI验证实现了最高的整体AUROC为0.88,而RAV实现了第二高的AUROC为0.66。
关键词
引用
@article{arxiv.2605.02443,
title = {HalluScan: A Systematic Benchmark for Detecting and Mitigating Hallucinations in Instruction-Following LLMs},
author = {Ahmed Cherif},
journal= {arXiv preprint arXiv:2605.02443},
year = {2026}
}
备注
38 pages, 13 figures, 10 tables. Submitted to Neural Computing and Applications