中文

CausalGuard:检测与防止大型语言模型中错误信息的智能系统

人工智能 2025-11-18 v1 信息检索

摘要

尽管大型语言模型已彻底变革了我们与 AI 系统交互的方式,但它们存在一个关键弱点:会自信地陈述完全可信的虚假信息。这种“幻觉”问题已成为阻止在最需准确性的场景中使用这些模型的主要障碍。现有解决方案要么需要重新训练整个模型,要么增加显著的计算开销,或错失这些幻觉发生的根本原因。我们提出了 CausalGuard,一种将因果推理与符号逻辑结合以实时捕捉和防止幻觉的新方法。与之前仅在生成后检查输出的方法不同,我们的系统理解导致虚假陈述的因果链,并在过程早期进行干预。CausalGuard 通过两种互补路径实现:一种追踪模型所知与其生成内容之间的因果关系,另一种使用自动化推理检查逻辑一致性。我们在十二个不同的基准测试中进行了测试,发现 CausalGuard 在正确识别幻觉方面达到 89.3% 的准确率,仅漏检 8.3% 的实际幻觉。更重要的是,它在保持响应自然且有帮助的同时,将虚假主张减少了近 80%。该系统在需要多个逻辑步骤的复杂推理任务中表现尤为出色。由于 CausalGuard 能显示其推理过程,它在医学诊断或金融分析等敏感领域表现良好,因为理解决策背后的原因与决策本身同样重要。

关键词

引用

@article{arxiv.2511.11600,
  title  = {CausalGuard: A Smart System for Detecting and Preventing False Information in Large Language Models},
  author = {Piyushkumar Patel},
  journal= {arXiv preprint arXiv:2511.11600},
  year   = {2025}
}