首个token知道:基于单解码置信度的幻觉检测
计算与语言
2026-05-07 v1 人工智能
摘要
自洽检测通过生成多个采样答案并衡量一致性来检测幻觉,但需要重复解码且对词汇变化敏感。语义自津性通过使用自然语言推理对采样答案按意义进行聚类来改进这一点,但增加了采样成本和外部推理开销。我们展示了从单个贪心解码中计算的首个token置信度(phi_first),即对前K个logits归一化熵在第一个有内容的答案token处计算的置信度,能够在封闭书籍的短答案事实性问题解答中匹配或略胜于语义自津性。跨三个7-8B指令调优模型和两个基准测试,phi_first实现了0.820的平均AUROC,相对于语义一致性的0.793和标准表面形式自津性的0.791。亚归属测试表明,phi_first与语义一致性呈中等到强相关性,两者组合仅在phi_first alone 上提高少量AUROC。这些结果表明,多采样一致性捕获的大部分不确定性信息已经存在于模型初始token分布中。我们认为,phi_first应作为默认低成本基线,在调用基于采样的不确定性估计之前报告。
引用
@article{arxiv.2605.05166,
title = {The First Token Knows: Single-Decode Confidence for Hallucination Detection},
author = {Mina Gabriel},
journal= {arXiv preprint arXiv:2605.05166},
year = {2026}
}
备注
6 pages, 1 figure