中文

MedicalNarratives:通过局部叙述连接医学视觉与语言

计算机视觉与模式识别 2026-01-15 v3

摘要

多模态模型数据需求量大。虽然具有自然图像的数据集丰富,但医学图像数据集无法提供相同便利。为实现大规模医学图像的表征学习,我们转向 YouTube 这一拥有大量开源医学教学视频的平台。我们精选 MedicalNarratives 数据集,包含 470 万医学图像-文本对,其中 100 万样本包含稠密注释,形式为空间轨迹(和边界框),以及 11.8 万个视频聚焦于轨迹事件(与文本对齐),实现单帧之外的时空定位。类似"思考 aloud"研究的方式,即在教师在其相关图像区域上移动鼠标光标时发表言语,MedicalNarratives 中的 100 万张图像包含局部鼠标轨迹的像素,创建了文本与像素之间的时空关联。为评估 MedicalNarratives 的实用性,我们使用我们的数据集在 12 个医学领域上训练 GenMedClip,采用类似 CLIP 的目标。GenMedClip 在新构建的医学影像基准测试上的所有 12 个领域均优于以往最先进模型。[数据链接]

关键词

引用

@article{arxiv.2501.04184,
  title  = {MedicalNarratives: Connecting Medical Vision and Language with Localized Narratives},
  author = {Wisdom O. Ikezogwo and Kevin Zhang and Mehmet Saygin Seyfioglu and Fatemeh Ghezloo and Linda Shapiro and Ranjay Krishna},
  journal= {arXiv preprint arXiv:2501.04184},
  year   = {2026}
}