通过形式化验证实现临床推理中的可靠性保证
计算机视觉与模式识别
2026-03-02 v1 人工智能
计算与语言
计算机科学中的逻辑
摘要
视觉语言模型(VLM)在撰写放射科报告方面显示出潜力,但经常因逻辑不一致而出现问题,即生成的诊断印象不受其自身感知发现的支持,或遗漏逻辑上必然的结论。标准词汇指标对临床改写严重惩罚,无法在无参考设置下捕捉这些演绎性失败。为了实现临床推理的可靠性保证,我们引入一种神经符号验证框架,对VLM生成的报告内部一致性进行确定性审计。我们的管道将自由文本放射性发现自动形式化为结构化命题证据,利用SMT求解器(Z3)和临床知识库验证每一诊断主张是否被数学上必然、幻觉或遗漏。评估七个VLM跨越五个胸X光基准测试, Our verifier 揭示了distinct reasoning failure modes,如保守观察和随机幻觉,这些在传统指标下几乎看不到。在标记数据集上,强制求解器支持的必然性作为严格的事后保证,系统性地消除不受支持的幻觉,从而显著提高生成性临床助理的诊断严谨性和准确性。
引用
@article{arxiv.2602.24111,
title = {Toward Guarantees for Clinical Reasoning in Vision Language Models via Formal Verification},
author = {Vikash Singh and Debargha Ganguly and Haotian Yu and Chengwei Zhou and Prerna Singh and Brandon Lee and Vipin Chaudhary and Gourav Datta},
journal= {arXiv preprint arXiv:2602.24111},
year = {2026}
}