医学影像 AI 竞赛缺乏公平性
计算机视觉与模式识别
2025-12-22 v1
摘要
基准测试竞赛是人工智能 (AI) 在医学影像领域发展的核心,定义了性能标准并塑造了方法论进程。然而,目前尚不清楚这些基准测试是否提供足够代表、可访问且可重复使用的实用临床数据以支持临床上有意义的 AI。在本工作中,我们沿两个互补维度评估了公平性:(1)挑战数据集是否代表真实世界临床多样性,(2)是否遵循 FAIR 原则实现可访问性和可重复使用。为回答此问题,我们对 241 个生物医学图像分析竞赛(涵盖 458 个任务、19 种影像模态)进行大规模系统性研究。我们的发现表明,数据集构成存在显著偏差,包括地理位置偏差、模态和问题类型相关偏差,表明当前基准测试不充分反映真实世界临床多样性。尽管其影响广泛,但挑战数据集常受限制性或模糊的访问条件、不一致或不合规的许可证实践以及不完整文档的制约,限制了可重复性和长期重用。总体而言,这些短板暴露了我们基准测试生态系统的根本性公平性局限,凸显了 leaderboard 成功与临床相关性之间的脱节。
引用
@article{arxiv.2512.17581,
title = {Medical Imaging AI Competitions Lack Fairness},
author = {Annika Reinke and Evangelia Christodoulou and Sthuthi Sadananda and A. Emre Kavur and Khrystyna Faryna and Daan Schouten and Bennett A. Landman and Carole Sudre and Olivier Colliot and Nick Heller and Sophie Loizillon and Martin Maška and Maëlys Solal and Arya Yazdan-Panah and Vilma Bozgo and Ömer Sümer and Siem de Jong and Sophie Fischer and Michal Kozubek and Tim Rädsch and Nadim Hammoud and Fruzsina Molnár-Gábor and Steven Hicks and Michael A. Riegler and Anindo Saha and Vajira Thambawita and Pal Halvorsen and Amelia Jiménez-Sánchez and Qingyang Yang and Veronika Cheplygina and Sabrina Bottazzi and Alexander Seitel and Spyridon Bakas and Alexandros Karargyris and Kiran Vaidhya Venkadesh and Bram van Ginneken and Lena Maier-Hein},
journal= {arXiv preprint arXiv:2512.17581},
year = {2025}
}
备注
Submitted to Nature BME