PubMed-Ophtha:用于训练眼科视觉语言模型的开放资源
计算机视觉与模式识别
2026-05-05 v1 计算与语言
摘要
视觉语言模型在眼科领域具有巨大的发展潜力,但其开发依赖大规模高质量的图像文本数据集,而此类数据集仍相对稀缺。我们提出 PubMed-Ophtha,一个包含 102,023 组眼科学术图像-文本对,来自 15,842 篇 PubMed Central 开放获取文章的分层数据集。与现有数据集不同,本数据集直接从文章 PDF 以原始分辨率提取图表,并分解为其组成面板、面板标识符和单个图像。每张图像都标注了其成像模式——色素血管照相术、光学相干断层扫描、视网膜成像或其他——以及标注状态指示注释标记(如箭头)的存在。图表标题使用两步 LLM 方法分为面板级别子标题,在人工标注数据上的平均句子 BLEU 分数为 0.913。面板和图像检测模型分别达到 [email protected] 为 0.909 和 0.892,图表提取 achieves 中位数 IoU 为 0.997。为支持可重复性,我们另外发布了人工标注的ground-truth数据、所有训练的模型以及完整的数据集生成管道。
关键词
引用
@article{arxiv.2605.02720,
title = {PubMed-Ophtha: An open resource for training ophthalmology vision-language models on scientific literature},
author = {Verena Jasmin Hallitschke and Carsten Eickhoff and Philipp Berens},
journal= {arXiv preprint arXiv:2605.02720},
year = {2026}
}
备注
12 pages, 4 figures, 3 supplementary figures. Dataset available at https://huggingface.co/datasets/pubmed-ophtha/PubMed-Ophtha. Code available at https://github.com/berenslab/pubmed-ophtha