从面板到像素:基于生物医学文献的细化视觉语言预训练
计算机视觉与模式识别
2026-03-26 v2 人工智能
摘要
发展强大的生物医学视觉语言模型正日益受到关注。流行的方法是使用大规模科学数据来实现稳健的表示。然而,当前的生物医学视觉语言预训练通常将丰富的科学图图和文本压缩为粗糙的图-level配对,丢弃了临床医生在放大局部结构时实际依赖的细粒度对应关系。为解决此问题,我们引入Panel2Patch——一种从现有生物医学文献中挖掘层次结构的数据管道,即多面板、含标记的图以及其周围文本,转换为多粒度监督。给定科学图和标题,Panel2Patch解析布局、面板和视觉标记,然后在图、面板和patch级别构建层次化对齐的视觉语言配对,保留局部语义,而不是将每个图视为单个数据样本。基于该层次化语料库,我们开发了一种粒度感知的预训练策略,将粗糙教学描述与细粒度区域聚焦短语统一。仅通过对少量文献图的应用,我们比以前的管道提取了更多有效的监督,实现了用更少的预训练数据获得显著更好的性能。
引用
@article{arxiv.2512.02566,
title = {From Panel to Pixel: Zoom-In Vision-Language Pretraining from Biomedical Scientific Literature},
author = {Kun Yuan and Min Woo Sun and Zhen Chen and Alejandro Lozano and Xiangteng He and Shi Li and Nassir Navab and Xiaoxiao Sun and Nicolas Padoy and Serena Yeung-Levy},
journal= {arXiv preprint arXiv:2512.02566},
year = {2026}
}