普及病理协作飞行员:面向whole-slide视觉语言建模的开放管道与数据集
计算机视觉与模式识别
2026-04-16 v2
摘要
视觉语言模型(VLMs)有望成为病理学家的协作飞行员。然而,大多数VLMs要么聚焦于whole-slide images(WSI)中小范围兴趣区域,要么仅提供slide-level的静态输出,要么依赖不可公开获取的数据,限制了可重复性。此外,训练数据中WSI与详细临床报告配对的情况稀缺,限制了向透明和通用的VLMs推进的进程。我们通过三个主要贡献来解决这些限制。首先,我们引入Polysome,一个用于合成指令生成的标准化工具。其次,我们将Polysome应用于公共HISTAI数据集,生成HISTAI-Instruct,一个覆盖24,259个切片、超过110万条指令-响应对的大型whole-slide指令调优数据集。最后,我们使用HISTAI-Instruct训练ANTONI-{\alpha},一个能够视觉-问题回答(VQA)的VLM。我们展示了ANTONI-{\alpha}在组织识别、肿瘤检测和差异诊断等WSI级别VQA任务中优于MedGemma。我们还比较了使用不同数据量训练的ANTONI-{\alpha}的多个版本。所有方法、数据和代码均公开可用。
关键词
引用
@article{arxiv.2512.17326,
title = {Democratising Pathology Co-Pilots: An Open Pipeline and Dataset for Whole-Slide Vision-Language Modelling},
author = {Sander Moonemans and Sebastiaan Ram and Frédérique Meeuwsen and Carlijn Lems and Jeroen van der Laak and Geert Litjens and Francesco Ciompi},
journal= {arXiv preprint arXiv:2512.17326},
year = {2026}
}
备注
12 pages, 4 figures