DL$^3$M:通过深度学习与大型语言模型实现专家级医学推理的视觉到语言框架
计算机视觉与模式识别
2026-02-24 v2 人工智能
摘要
医学图像分类器能很好地检测胃肠道疾病,但它们无法解释其决策。大型语言模型可以生成临床文本,但在视觉推理方面存在困难,且经常产生不稳定或不正确的解释。这在模型所见与临床医生期望的推理类型之间留下了鸿沟。我们引入了一个将图像分类与结构化临床推理相联系的框架。一种新的混合模型 MobileCoAtNet 专为内窥镜图像设计,在八个胃相关类别上实现了高准确率。其输出随后被用于驱动多个 LLM 的推理。为了评判这种推理,我们构建了两个经专家验证的基准,涵盖病因、症状、治疗、生活方式和随访护理。三十二个 LLM 根据这些黄金标准进行了评估。强大的分类提高了其解释的质量,但没有一个模型达到人类水平的稳定性。即使是最好的 LLM 也会在提示变化时改变其推理。我们的研究表明,将 DL 与 LLM 结合可以产生有用的临床叙述,但当前的 LLM 对于高风险医疗决策仍然不可靠。该框架提供了对其局限性的更清晰认识,以及构建更安全推理系统的路径。本研究所用的完整源代码和数据集可在 https://github.com/souravbasakshuvo/DL3M 获取。
引用
@article{arxiv.2512.13742,
title = {DL$^3$M: A Vision-to-Language Framework for Expert-Level Medical Reasoning through Deep Learning and Large Language Models},
author = {Md. Najib Hasan and Imran Ahmad and Sourav Basak Shuvo and Md. Mahadi Hasan Ankon and Sunanda Das and Nazmul Siddique and Hui Wang},
journal= {arXiv preprint arXiv:2512.13742},
year = {2026}
}
备注
This work was submitted without the consent of my current adviser. Additionally, it overlaps with my unpublished research work. In order to avoid potential academic and authorship conflicts, I am requesting withdrawal of the paper