中文

面向胃肠诊断的临床认知对齐型多模态大语言模型

计算机视觉与模式识别 2026-04-10 v2 计算与语言

摘要

多模态大语言模型(Multimodal Large Language Models, MLLMs)在医学图像分析中展现出巨大潜力,但其在胃肠镜应用Currently受限于两个关键限制:通用模型推理与标准化临床认知路径之间的错位,以及视觉特征与诊断结果之间缺乏因果关联。为此,本文提出一种新型临床认知对齐(Clinical-Cognitive-Aligned, CogAlign)框架以应对这些挑战。首先,我们通过构建分层临床认知数据集并采用监督微调(Supervised Fine-Tuning, SFT)为模型赋予严谨的临床分析能力。不同于常规方法,此策略将专家从解剖定位、形态评估到微血管分析的分层诊断逻辑直接内置于模型中。其次,为消除视觉偏见,我们提供理论分析表明常规监督调优必然收敛于虚构背景关联。基于此洞见,我们提出一种反事实驱动的强化学习策略,以实现因果纠正。通过对肿瘤遮蔽生成反事实正常样本并通过以临床认知为中心的奖励进行优化,我们约束模型严格以因果肿瘤特征为依据进行诊断。广泛实验表明,我们的方法在多个基准测试中实现了最先进(State-of-the-Art, SoTA)性能,显著提升了复杂临床情景中的诊断准确性。所有源代码和数据集将公开提供。

关键词

引用

@article{arxiv.2603.20698,
  title  = {Clinical Cognition Alignment for Gastrointestinal Diagnosis with Multimodal LLMs},
  author = {Huan Zheng and Yucheng Zhou and Tianyi Yan and Dubing Chen and Hongbo Lu and Wenlong Liao and Tao He and Pai Peng and Jianbing Shen},
  journal= {arXiv preprint arXiv:2603.20698},
  year   = {2026}
}