Touchstone 基准:我们评估医学分割 AI 算法的方法是否正确?
计算机视觉与模式识别
2025-01-22 v2 人工智能
摘要
如何测试 AI 性能?这个问题看似简单,但并非如此。标准基准常存在分布内与小规模测试集、过度简化的指标、不公平的比较以及短期结果压力等问题。因此,在标准基准上表现良好并不能保证在真实场景中取得成功。为解决这些问题,我们提出了 Touchstone,一个涵盖 9 种腹部器官的大规模协作分割基准。该基准基于来自全球 76 家医院的 5,195 张训练 CT 扫描和来自另外 11 家医院的 5,903 张测试 CT 扫描。这种多样化的测试集增强了基准结果的统计显著性,并严格评估了 AI 算法在各种分布外场景中的表现。我们邀请了来自 19 个 AI 算法的 14 位发明者来训练其算法,而我们的团队作为第三方独立评估了这些算法。此外,我们还评估了预先存在的 AI 框架——与算法不同,这些框架更灵活,可支持不同算法——包括 NVIDIA 的 MONAI、DKFZ 的 nnU-Net 以及众多其他开源框架。我们致力于扩展该基准,以鼓励医学领域 AI 算法的更多创新。
引用
@article{arxiv.2411.03670,
title = {Touchstone Benchmark: Are We on the Right Way for Evaluating AI Algorithms for Medical Segmentation?},
author = {Pedro R. A. S. Bassi and Wenxuan Li and Yucheng Tang and Fabian Isensee and Zifu Wang and Jieneng Chen and Yu-Cheng Chou and Yannick Kirchhoff and Maximilian Rokuss and Ziyan Huang and Jin Ye and Junjun He and Tassilo Wald and Constantin Ulrich and Michael Baumgartner and Saikat Roy and Klaus H. Maier-Hein and Paul Jaeger and Yiwen Ye and Yutong Xie and Jianpeng Zhang and Ziyang Chen and Yong Xia and Zhaohu Xing and Lei Zhu and Yousef Sadegheih and Afshin Bozorgpour and Pratibha Kumari and Reza Azad and Dorit Merhof and Pengcheng Shi and Ting Ma and Yuxin Du and Fan Bai and Tiejun Huang and Bo Zhao and Haonan Wang and Xiaomeng Li and Hanxue Gu and Haoyu Dong and Jichen Yang and Maciej A. Mazurowski and Saumya Gupta and Linshan Wu and Jiaxin Zhuang and Hao Chen and Holger Roth and Daguang Xu and Matthew B. Blaschko and Sergio Decherchi and Andrea Cavalli and Alan L. Yuille and Zongwei Zhou},
journal= {arXiv preprint arXiv:2411.03670},
year = {2025}
}
备注
Accepted to NeurIPS-2024