中文

医学领域可信AI:基于CHECK的持续 hallucination 检测与消除

计算与语言 2025-06-16 v1 人工智能

摘要

大语言模型(LLM)在医疗领域显示出巨大的潜力,但幻觉(hallucination)仍是临床应用的主要障碍。我们提出CHECK——一个持续学习框架,将结构化临床数据库与基于信息论的分类器集成,用于检测事实性和推理性幻觉。在1500个来自100个关键临床试验的问题上进行评估,CHECK将LLaMA3.3-70B-Instruct的幻觉率从31%降至0.3%,达到开源模型的突破性水平。其分类器在医学基准测试中具有良好的 generalization,包括MedQA(USMLE)基准和HealthBench现实多轮医疗问答,AUC均达到0.95-0.96。通过利用幻觉概率指导GPT-4o进行精炼并智能分配计算资源,CHECK将其USMLE通过率提升5个百分点,达到最先进的92.1%。通过将幻觉率压制至临床公认的错误阈值以下,CHECK为医疗及其他高风险领域的安全LLM部署提供了可扩展的基础。

关键词

引用

@article{arxiv.2506.11129,
  title  = {Trustworthy AI for Medicine: Continuous Hallucination Detection and Elimination with CHECK},
  author = {Carlos Garcia-Fernandez and Luis Felipe and Monique Shotande and Muntasir Zitu and Aakash Tripathi and Ghulam Rasool and Issam El Naqa and Vivek Rudrapatna and Gilmer Valdes},
  journal= {arXiv preprint arXiv:2506.11129},
  year   = {2025}
}