MedicalNarratives:通过局部叙述连接医学视觉与语言
计算机视觉与模式识别
2026-01-15 v3
摘要
多模态模型数据需求量大。虽然具有自然图像的数据集丰富,但医学图像数据集无法提供相同便利。为实现大规模医学图像的表征学习,我们转向 YouTube 这一拥有大量开源医学教学视频的平台。我们精选 MedicalNarratives 数据集,包含 470 万医学图像-文本对,其中 100 万样本包含稠密注释,形式为空间轨迹(和边界框),以及 11.8 万个视频聚焦于轨迹事件(与文本对齐),实现单帧之外的时空定位。类似"思考 aloud"研究的方式,即在教师在其相关图像区域上移动鼠标光标时发表言语,MedicalNarratives 中的 100 万张图像包含局部鼠标轨迹的像素,创建了文本与像素之间的时空关联。为评估 MedicalNarratives 的实用性,我们使用我们的数据集在 12 个医学领域上训练 GenMedClip,采用类似 CLIP 的目标。GenMedClip 在新构建的医学影像基准测试上的所有 12 个领域均优于以往最先进模型。[数据链接]
关键词
引用
@article{arxiv.2501.04184,
title = {MedicalNarratives: Connecting Medical Vision and Language with Localized Narratives},
author = {Wisdom O. Ikezogwo and Kevin Zhang and Mehmet Saygin Seyfioglu and Fatemeh Ghezloo and Linda Shapiro and Ranjay Krishna},
journal= {arXiv preprint arXiv:2501.04184},
year = {2026}
}