当答案偏离问题:基于问答正交分解的幻觉检测
机器学习
2026-05-15 v1 人工智能
计算与语言
摘要
大语言模型(LLM)中的幻觉检测需要在准确率、效率和分布偏移鲁棒性之间取得平衡。黑盒一致性方法有效但需要重复推理;单遍白盒探针高效但孤立地处理答案表示,在领域偏移下往往急剧退化。我们提出QAOD(问答正交分解),一种单遍框架,从答案表示中投影去除问题对齐方向,以获取抑制领域条件变化的正交问题分量。为识别信息信号,QAOD进一步通过多样性惩罚的Fisher评分选择层,并通过Fisher重要性选择判别性神经元。为同时解决域内检测和跨域泛化问题,我们设计了两种互补的探针策略:将正交分量与问题上下文配对产生联合探针,最大化域内判别性;而单独使用正交分量则保留领域无关的事实性信号以实现鲁棒迁移。QAOD的联合探针在所有评估的模型-数据集对上取得了最佳的域内AUROC,而仅正交探针提供了最强的OOD迁移,在BioASQ上以不到25%的生成成本超越最佳白盒基线高达21%。
引用
@article{arxiv.2605.14449,
title = {When Answers Stray from Questions: Hallucination Detection via Question-Answer Orthogonal Decomposition},
author = {Siyang Yao and Erhu Feng and Yubin Xia},
journal= {arXiv preprint arXiv:2605.14449},
year = {2026}
}