从凝视到洞察:连接人类视觉注意与视觉语言模型解释的弱监督医学图像分割
计算机视觉与模式识别
2025-10-07 v2
摘要
由于像素级标注训练成本高昂,医学图像分割仍然具有挑战性。在弱监督背景下,临床医生的凝视数据捕捉了诊断感兴趣的区域;然而,其稀疏性限制了其在分割中的使用。相比之下,视觉语言模型(VLM)通过文本描述提供语义上下文,但缺乏所需的解释精度。认识到单一来源都不足以满足要求,我们提出了一种教师-学生框架,该框架整合了凝视和语言监督,利用它们的互补优势。我们的关键见解是,凝视数据指示了临床医生在诊断过程中关注的位置,而VLM解释了这些区域为何重要。为实现这一点,教师模型首先从由VLM生成的病变形态描述增强的凝视点中学习,为引导学生模型建立基础。然后,教师通过三种策略指导学生:(1)多尺度特征对齐,融合视觉线索与文本语义;(2)置信度加权一致性约束,聚焦于可靠预测;(3)自适应掩蔽,限制不确定区域的误差传播。在Kvasir-SEG、NCI-ISBI和ISIC数据集上的实验表明,我们的方法分别达到了80.78%、80.53%和84.22%的Dice分数——相比凝视基线提高了3-5%,且未增加标注负担。通过保持预测、凝视数据和病变描述之间的相关性,我们的框架还保持了临床可解释性。这项工作说明了如何将人类视觉注意与AI生成的语义上下文相结合,有效克服单个弱监督信号的局限性,从而推动可部署、标注高效的医学AI系统的发展。代码可在https://github.com/jingkunchen/FGI获取。
引用
@article{arxiv.2504.11368,
title = {From Gaze to Insight: Bridging Human Visual Attention and Vision Language Model Explanation for Weakly-Supervised Medical Image Segmentation},
author = {Jingkun Chen and Haoran Duan and Xiao Zhang and Boyan Gao and Vicente Grau and Jungong Han},
journal= {arXiv preprint arXiv:2504.11368},
year = {2025}
}
备注
11 pages, 4 figures