中文

ClinKD:面向多任务医学图像的跨模态临床知识蒸馏器

计算机视觉与模式识别 2025-07-14 v4

摘要

医学视觉问答 (Med-VQA) 是通用 VQA 领域中的一个关键且具有挑战性的子任务。尽管通用 VQA 领域取得了显著进展,多模态大语言模型 (MLLM) 在处理多任务 VQA 场景时仍存在显著局限,这些局限表现为空间定位错误和对医学图像的误解释,主要源于两个根本性问题:图像-文本对齐不足以及医学应用领域的知识不足。为此,我们引入跨模态临床知识蒸馏器 (ClinKD),一种旨在增强图像-文本对齐并建立更有效医学知识转换机制的创新框架,从而使 MLLM 即使缺乏先验医学知识也能获得更好的性能。我们进行了大量实验评估,证明 ClinKD 在几组对 Med-VQA 任务具有挑战性的数据集上实现了最先进的性能。结果表明,我们的方法不仅显著改善了图像-文本对齐,还有效地使 MLLM 能够适应医学知识。ClinKD 的源代码可在 https://github.com/overloadedHenry/ClinKD 获取。

关键词

引用

@article{arxiv.2502.05928,
  title  = {ClinKD: Cross-Modal Clinical Knowledge Distiller For Multi-Task Medical Images},
  author = {Hongyu Ge and Longkun Hao and Zihui Xu and Zhenxin Lin and Bin Li and Shoujun Zhou and Hongjin Zhao and Yihang Liu},
  journal= {arXiv preprint arXiv:2502.05928},
  year   = {2025}
}