设计UNICORN:面向计算病理学、放射学与自然语言成像的统一基准
计算机视觉与模式识别
2026-03-04 v1
摘要
医学基础模型显示出从大型异构数据集中学习广泛可泛化特征的潜力。这可作为可靠的跨模态泛化和快速适应新特定任务的基础,仅需少量任务特定示例。然而,由于缺乏面向公开、标准化和可重复评估框架的证据,尤其是现有公开基准常常在任务、器官或模态特定设置中碎片化,限制了跨任务泛化的评估。我们引入UNICORN,一个旨在统一协议下系统评估医学基础模型的公开基准。为隔离表征质量,我们构建了该基准基于一种新颖的两步框架,将模型推断与基于标准化few-shot适应的任务特定评估解耦。作为核心设计选择,我们构建了间接可访问的隔离测试集,源自临床相关队列,并附带标准化评估代码和开放基准平台上的提交接口。性能汇总为单一的UNICORN评分,我们引入的新指标,以支持跨 diverse 医学领域、模态和任务类型的直接比较。UNICORN测试数据集包括来自2400多名患者的数据,包括3700多例视觉案例和2400多篇临床报告,来自8个国家17个机构。该基准涵盖8个解剖区域和4种成像模态。任务特定和汇总排行榜均支持可访问、标准化和可重复的评估。通过标准化多任务、多模态评估,UNICORN为医学基础模型的可重复基准测试奠定了基础。数据、基线方法和评估平台均可通过unicorn.grand-challenge.org公开获取。
关键词
引用
@article{arxiv.2603.02790,
title = {Designing UNICORN: a Unified Benchmark for Imaging in Computational Pathology, Radiology, and Natural Language},
author = {Michelle Stegeman and Lena Philipp and Fennie van der Graaf and Marina D'Amato and Clément Grisi and Luc Builtjes and Joeran S. Bosma and Judith Lefkes and Rianne A. Weber and James A. Meakin and Thomas Koopman and Anne Mickan and Mathias Prokop and Ewoud J. Smit and Geert Litjens and Jeroen van der Laak and Bram van Ginneken and Maarten de Rooij and Henkjan Huisman and Colin Jacobs and Francesco Ciompi and Alessa Hering},
journal= {arXiv preprint arXiv:2603.02790},
year = {2026}
}
备注
This paper describes the dataset and design of the UNICORN challenge and provides the link to Grand Challenge