A-Eval:腹部多器官分割的跨数据集评测基准
图像与视频处理
2025-02-20 v1 计算机视觉与模式识别
摘要
尽管深度学习已革新腹部多器官分割,模型常因在小规模特定数据集上训练而难以泛化。随着近期大规模数据集的出现,一些重要问题随之产生:\textbf{在这些数据集上训练的模型能否在不同数据集上良好泛化?若能/若不能,如何进一步提升其泛化能力?}为解答这些问题,我们引入A-Eval,一个用于腹部('A')多器官分割跨数据集评测('Eval')的基准。我们采用四个大规模公开数据集的训练集:FLARE22、AMOS、WORD和TotalSegmentator,每个均提供腹部多器官分割的广泛标注。为评测,我们整合这些数据集的验证集与BTCV数据集的训练集,构成一个含五个不同数据集的鲁棒基准。我们利用A-Eval基准评估多种模型的泛化性,聚焦于多样数据使用场景:独立在各数据集上训练、通过伪标签利用无标注数据、混合不同模态,以及跨所有可用数据集的联合训练。此外,我们探究模型规模对跨数据集泛化性的影响。通过这些分析,我们强调了有效数据使用在增强模型泛化能力中的重要性,为构建大规模数据集与改进训练策略提供宝贵见解。代码与预训练模型见\href{https://github.com/uni-medical/A-Eval}{https://github.com/uni-medical/A-Eval}。
引用
@article{arxiv.2309.03906,
title = {A-Eval: A Benchmark for Cross-Dataset Evaluation of Abdominal Multi-Organ Segmentation},
author = {Ziyan Huang and Zhongying Deng and Jin Ye and Haoyu Wang and Yanzhou Su and Tianbin Li and Hui Sun and Junlong Cheng and Jianpin Chen and Junjun He and Yun Gu and Shaoting Zhang and Lixu Gu and Yu Qiao},
journal= {arXiv preprint arXiv:2309.03906},
year = {2025}
}