中文

视线引导的多模态对齐用于医学表征学习

计算机视觉与模式识别 2024-06-17 v3 计算与语言

摘要

在医学多模态框架中,跨模态特征的对齐是一个重大挑战。然而,现有工作从数据中学习隐式对齐的特征,并未考虑医学上下文中的显式关系。这种对数据的依赖可能导致所学对齐关系的泛化能力较低。在本工作中,我们提出视线引导的多模态对齐(EGMA)框架,利用视线数据更好地对齐医学视觉和文本特征。我们探索了放射科医生视线数据在医学图像和文本对齐中的天然辅助作用,并引入了一种新颖的方法,使用在放射科医生诊断评估期间同步采集的视线数据。我们在四个医学数据集上进行了图像分类和图像-文本检索的下游任务,其中EGMA取得了最先进的性能,并在不同数据集上表现出更强的泛化能力。此外,我们探索了不同数量的视线数据对模型性能的影响,凸显了将此辅助数据整合到多模态对齐框架中的可行性和实用性。

关键词

引用

@article{arxiv.2403.12416,
  title  = {Eye-gaze Guided Multi-modal Alignment for Medical Representation Learning},
  author = {Chong Ma and Hanqi Jiang and Wenting Chen and Yiwei Li and Zihao Wu and Xiaowei Yu and Zhengliang Liu and Lei Guo and Dajiang Zhu and Tuo Zhang and Dinggang Shen and Tianming Liu and Xiang Li},
  journal= {arXiv preprint arXiv:2403.12416},
  year   = {2024}
}

备注

12 pages, 6 figures