中文

当模型学习提问:面向可信医学视觉语言模型的自适应因果推理

网络与互联网体系结构 2026-03-25 v1

摘要

视觉语言模型(VLMs)通过整合视觉感知与语言推理,已实现可解释的医学诊断。然而,现有医学链式思维(CoT)模型缺乏显式机制来表示和强制执行因果推理,使其易受虚假关联影响,限制了临床可靠性。我们指出了医学CoT推理中的三个核心挑战:如何自适应触发因果纠正、构建高质量的因果-虚假对比样本、以及在推理轨迹之间维持因果一致性。为此,我们提出了MedCausalX框架,显式建模医学VLMs中的因果推理链。我们首先引入CRMed数据集,提供细粒度解剖标注、结构化因果推理链,以及反事实变体,以指导学习超越表面关联的因果关系。基于CRMed,MedCausalX采用配备<因果>和<验证>标记的两阶段自适应反思架构,使模型能够自主确定何时以及如何进行因果分析和验证。最后,通过基于误差归因的强化学习优化轨迹级因果纠正目标,使模型能够区分真实的因果依赖关系与捷径关联。广泛的实验表明,MedCausalX在多个基准测试中 consistently 优于最先进的方法,诊断一致性提升5.4分,幻觉减少10分以上,实现顶级空间定位IoU,为基于因果的医学推理树立了新标准。该代码和数据集已在https://github.com/zhcz328/MedCausalX 上提供。

关键词

引用

@article{arxiv.2603.23084,
  title  = {Symbol-Synchronous Communication for Ultra-Low-Power Multi-Hop Ambient IoT Networks},
  author = {Xinlei Liu and Andrey Belogaev and Jeroen Famaey},
  journal= {arXiv preprint arXiv:2603.23084},
  year   = {2026}
}