中文

通过专家标注提升医学多模态对比学习

计算机视觉与模式识别 2024-07-16 v3 机器学习

摘要

我们提出了 eCLIP 模型,该模型将专家标注(放射科医生的注视热力图)集成到 CLIP 框架中,以解决医学多模态成像分析中的关键挑战,尤其是数据稀缺和模态间隙——即图像与文本嵌入之间巨大的差异,削弱了表示质量并阻碍了跨模态互操作性。eCLIP 集成了热力图处理器,并利用 mixup 数据增强有效利用稀缺的专家标注,从而提升模型的学习效果。eCLIP 可适用于任何 CLIP 变体,无需修改核心架构。通过在多个任务上的详细评估,包括零样本推理、线性探测、跨模态检索以及使用冻结的大型语言模型生成放射学报告的检索增强生成(RAG),eCLIP 均展现出一致的性能提升。结果表明,eCLIP 在嵌入质量方面实现了更好的对齐性和一致性,证明了其在医学影像领域利用高质量标注来增强多模态分析的潜力。

关键词

引用

@article{arxiv.2403.10153,
  title  = {Improving Medical Multi-modal Contrastive Learning with Expert Annotations},
  author = {Yogesh Kumar and Pekka Marttinen},
  journal= {arXiv preprint arXiv:2403.10153},
  year   = {2024}
}

备注

Accepted to ECCV 2024