中文

我真的知道吗?学习事实自验证以减少幻觉

人工智能 2026-02-03 v1

摘要

事实性幻觉是大语言模型(LLM)面临的核心挑战。现有缓解方法主要依赖外部后置验证或直接将不确定性映射到训练期间的放弃决策,往往导致过于保守。我们提出VeriFY,一种在训练时教会LLM通过一致性自验证来推理事实不确定性的框架。VeriFY通过结构化验证痕迹增强训练,引导模型生成初始答案、生成并回答探测性验证查询、发布一致性判断,然后决定是否回答或放弃。为解决在训练增强痕迹上强化幻觉内容的风险,我们引入了一种阶段级损失掩码方法,排除幻觉答案阶段的训练目标,同时保留对验证行为的监督。在多个模型家族和规模上,VeriFY将事实性幻觉率降低了9.7%至53.3%,仅略微降低召回率(0.4%至5.7%),且在单一数据源上训练时能够跨数据集泛化。源代码、训练数据和训练好的模型检查点将在接受后公开。

关键词

引用

@article{arxiv.2602.02018,
  title  = {Do I Really Know? Learning Factual Self-Verification for Hallucination Reduction},
  author = {Enes Altinisik and Masoomali Fatehkia and Fatih Deniz and Nadir Durrani and Majd Hawasly and Mohammad Raza and Husrev Taha Sencar},
  journal= {arXiv preprint arXiv:2602.02018},
  year   = {2026}
}