面向大语言模型的反事实探针:用于幻觉检测与缓解
计算与语言
2025-08-05 v1 人工智能
摘要
大语言模型在 diverse 任务中展现出惊人的能力,但常常生成流畅却事实错误或缺乏依据的幻觉输出。我们提出反事实探针(Counterfactual Probing),一种新颖的大语言模型幻觉检测与缓解方法。该方法动态生成看似合理但包含细微事实错误的反事实陈述,然后评估模型对这些扰动的敏感性。我们假设,真实知识对反事实变体具有鲁棒性,而幻觉内容在面对合理替代方案时会表现出不一致的置信度模式。我们在 TruthfulQA、事实陈述数据集以及精选的幻觉示例上进行了全面评估,结果表明反事实探针在检测性能上优于基线方法,而我们的自适应缓解策略可使幻觉得分平均下降 24.5%。该方法无需模型重新训练,可集成到现有的大语言模型管道中作为实时验证机制。
引用
@article{arxiv.2508.01862,
title = {Counterfactual Probing for Hallucination Detection and Mitigation in Large Language Models},
author = {Yijun Feng},
journal= {arXiv preprint arXiv:2508.01862},
year = {2025}
}