CHAIR:作为改进器的幻觉分类器
计算与语言
2025-01-23 v2
摘要
在本工作中,我们引入了 CHAIR(作为改进器的幻觉分类器),这是一种通过分析每个 token 在每一层的内部 logits 来检测幻觉的监督框架。我们的方法从所有层的 token logits 中提取一组紧凑的特征,如最大值、最小值、均值、标准差和斜率,从而在不发生过拟合的情况下实现有效的幻觉检测。在 TruthfulQA 和 MMLU 数据集上的实验表明,CHAIR 显著提高了检测准确率,尤其是在零样本场景中,展示了其鲁棒性和泛化能力。除了幻觉检测之外,CHAIR 还突出了利用内部表示来设计高级解码策略的潜力。通过利用 logits 中的模式,我们建议更复杂的模型和自适应解码方法可以进一步减少幻觉并提高文本补全质量。CHAIR 不仅为检测幻觉提供了实用的解决方案,还为探索 LLM 中更丰富的表示以提高其事实性和连贯性奠定了基础。
引用
@article{arxiv.2501.02518,
title = {CHAIR -- Classifier of Hallucination as Improver},
author = {Ao Sun},
journal= {arXiv preprint arXiv:2501.02518},
year = {2025}
}