中文

DALPHIN:基准测试数字病理AI助理士在开放多中心数据集上的表现

计算机视觉与模式识别 2026-05-06 v1 人工智能

摘要

具有数字病理视觉问答能力的基础模型正悄然涌现。这种前所未有的技术需要独立的基准测试来评估其在辅助病理医生进行常规诊断方面的潜力。我们创建了DALPHIN,这是首个用于病理AI助理士的多中心开放基准测试,包含1236张图像,覆盖300个病例,涵盖130种罕见至常见诊断,来自6个国家,14个子专科。介绍DALPHIN的设计与数据集,以及来自10个国家31名病理医生的人类绩效基准。我们报告了两款通用型(GPT-5、Gemini 2.5 Pro)和一款针对病理学的助理士(PathChat+)的顺序与独立答案生成结果。我们观察到PathChat在四个六个任务中表现出与专家水平相当,Gemini为2/6任务,GPT为1/6任务。DALPHIN公开发布,采用隔离且间接可访问的ground truth,以促进稳健且持久的基准测试。数据、方法及评估平台可通过alphin.grand-challenge.org访问。

关键词

引用

@article{arxiv.2605.03544,
  title  = {DALPHIN: Benchmarking Digital Pathology AI Copilots Against Pathologists on an Open Multicentric Dataset},
  author = {Carlijn Lems and Sander Moonemans and Natálie Klubíčková and Biagio Brattoli and Taebum Lee and Seokhwi Kim and Veronica Vilaplana and Laura Pons and Sapir Hochman and Mauricio Eduardo Suárez-Franck and Pedro Luis Fernandez and Julius Drachneris and Donatas Petroska and Renaldas Augulis and Arvydas Laurinavicius and Domingos Oliveira and Diana Montezuma and Anouk B. Bouwmeester and Dominique van Midden and Anne-Marie Vos and Shoko Vos and Jolique van Ipenburg and Maschenka Balkenhol and Koen Winkler and Iris Nagtegaal and Konnie Hebeda and Uta Flucke and Katrien Grünberg and Josef Skopal and Brinder S. Chohan and Jordi Temprana-Salvador and Enrico Munari and Luca Cima and Giulia Querzoli and Yosamin Gonzalez Belisario and Jaeike W. Faber and Geert J. L. H. van Leenders and Jan H. von der Thüsen and Lodewijk A. A. Brosens and Ronald R. de Krijger and Pieter Wesseling and Sandrine Florquin and Mateusz Maniewski and Adam Kowalewski and Robert Barna and Dina Tiniakos and Joan Lop Gros and Rogier Donders and Jake S. F. Maurits and Ming Yang Lu and Chengkuan Chen and Faisal Mahmood and Jeroen van der Laak and Nadieh Khalili and Frédérique Meeuwsen and Francesco Ciompi},
  journal= {arXiv preprint arXiv:2605.03544},
  year   = {2026}
}

备注

Our dataset is available at https://zenodo.org/records/18609450 , our code is available at https://github.com/computationalpathologygroup/DALPHIN , and our benchmark is available at https://dalphin.grand-challenge.org/