多评分者校准分割模型
计算机视觉与模式识别
2026-05-05 v1
摘要
目标:准确的概率估计对于医学图像分割模型在临床决策中的安全部署至关重要。然而,现代深度分割网络往往校准性差,该问题在多个专家注释显示显著不一致时更为突出。虽然通常将评估间变异性视为噪声,但它提供了关于固有注释模糊性的宝贵信息,必须在模型置信度中予以反映。方法:我们通过将多评分者监督重新表述为序数学习问题,来提高医学图像分割模型的概率校准。肌段内评估者一致性被视为有序目标,将预测置信度与训练数据中的经验变异性相联系。这种表述允许使用序数感知评分规则,如Ranked Probability Score序数损失,结合标准二元目标以保留判别性能。结果:我们在四个公共分割基准(涵盖眼科、组织病理和胸部成像)上评估了所提出的方法。通过多评分者扩展的预期校准误差评估了校准性。结果一致显示,序数感知训练在不损害分割精度的同时,显著改善了相对于评估间一致性的校准性。结论:将多评分者注释视为有序信息,为更可靠的概率分割模型提供了原则且与体系结构无关的途径。
引用
@article{arxiv.2605.02437,
title = {Multi-Rater Calibrated Segmentation Models},
author = {Meritxell Riera-Marín and Javier García López and Júlia Rodríguez-Comas and Miguel A. González Ballester and Adrian Galdran},
journal= {arXiv preprint arXiv:2605.02437},
year = {2026}
}