中文

基于粒粒核查与领域特定适配的医疗 LLM 幻觉缓解

计算与语言 2026-05-26 v3

摘要

在医疗领域,任何 LLM 生成的输出都必须可靠准确,尤其是涉及决策和患者安全时。然而,由于 LLM 的幻觉风险,这些输出在关键领域常不可靠。为此,我们提出一个独立于任何 LLM 的 fact-checking 模块,以及一个针对降低幻觉率设计的领域特定摘要模型。该模型基于 Low-Rank Adaptation (LoRa) 在 MIMIC III 数据集上微调,并配合 fact-checking 模块使用,该模块通过数值测试进行正确性检验,以及通过自然语言处理中的离散逻辑进行粒粒层面的逻辑检查,以验证对电子健康记录 (EHR) 中的事实。我们在完整的 MIMIC-III 数据集上训练了 LLM 摘要模型。对于 fact-checking 模块的评估,我们抽取了 104 条摘要,提取出 3,786 条命题,用这些命题作为事实进行检验。fact-checking 模块在精确率、召回率和 F1 分数上分别达到 0.8904、0.8234 和 0.8556。此外,LLM 摘要模型在摘要质量方面实现了 ROUGE-1 分数为 0.5797 和 BERTScore 为 0.9120。

关键词

引用

@article{arxiv.2512.16189,
  title  = {Mitigating Hallucinations in Healthcare LLMs with Granular Fact-Checking and Domain-Specific Adaptation},
  author = {Musarrat Zeba and Abdullah Al Mamun and Kishoar Jahan Tithee and Debopom Sutradhar and Mohaimenul Azam Khan Raiaan and Saddam Mukta and Reem E. Mohamed and Md Rafiqul Islam and Yakub Sebastian and Mukhtar Hussain and Sami Azam},
  journal= {arXiv preprint arXiv:2512.16189},
  year   = {2026}
}