中文

注视图像:基于凝视监督的多模态学习用于胸部X光诊断与报告生成

计算机视觉与模式识别 2025-08-19 v1 机器学习

摘要

我们提出一个两阶段多模态框架,利用MIMIC-Eye数据集增强胸部X光片的疾病分类和区域感知放射学报告生成。在第一阶段,我们引入一种凝视引导的对比学习架构用于疾病分类。该架构整合了视觉特征、临床标签、边界框和放射科医生眼动追踪信号,并配备了一个新颖的多项凝视注意力损失函数,该函数结合了均方误差、KL散度、相关性和质心对齐。纳入注视点将F1分数从0.597提升至0.631(+5.70%),AUC从0.821提升至0.849(+3.41%),同时提高了精确率和召回率,突显了凝视信息注意力监督的有效性。在第二阶段,我们提出一个模块化报告生成流程,该流程提取置信度加权的诊断关键词,利用由领域特定先验知识构建的精选词典将其映射到解剖区域,并通过结构化提示生成区域对齐的句子。根据临床关键词召回率和ROUGE重叠度衡量,该流程提高了报告质量。我们的结果表明,整合凝视数据既提高了分类性能,也增强了生成医学报告的可解释性。

关键词

引用

@article{arxiv.2508.13068,
  title  = {Eyes on the Image: Gaze Supervised Multimodal Learning for Chest X-ray Diagnosis and Report Generation},
  author = {Tanjim Islam Riju and Shuchismita Anwar and Saman Sarker Joy and Farig Sadeque and Swakkhar Shatabda},
  journal= {arXiv preprint arXiv:2508.13068},
  year   = {2025}
}