中文

基于 UniverSeg 对监督医学图像分割模型在无标签数据上的绩效进行估计

机器人学 2025-04-23 v1

摘要

医学图像分割模型的绩效通常通过 Dice 评分和滞后 Hausdorff 距离等指标进行评估,这些指标将预测掩码与真实标注进行比较。然而,在临床应用等不可见数据上应用模型时,往往不可能为所有数据进行标注,从而使模型的绩效不确定。为此,我们提出一种名为 Segmentation Performance Evaluator(SPE)的框架,用于估计医学图像分割模型在无标签数据上的绩效。该框架适用于各种评估指标和模型体系结构。实验在六个公开数据集上进行,涵盖六种评估指标,包括像素级指标如 Dice 评分和距离级指标如 HD95。结果表明,该方法的相关性高达 0.956±\pm0.046,平均绝对误差(MAE)为 0.025±\pm0.019,与独立测试集上的真实 Dice 评分相当。这些结果突显了该方法在无需标注的情况下可靠估计模型绩效的能力。SPE 框架无缝集成到任何模型训练过程中,不增加训练开销,从而实现绩效估计,促进了医学图像分割算法的实际应用。源代码已公开。

关键词

引用

@article{arxiv.2504.15666,
  title  = {Symbolic Runtime Verification and Adaptive Decision-Making for Robot-Assisted Dressing},
  author = {Yasmin Rafiq and Gricel Vázquez and Radu Calinescu and Sanja Dogramadzi and Robert M Hierons},
  journal= {arXiv preprint arXiv:2504.15666},
  year   = {2025}
}