中文

我们是否使用了恰当的分割度量?识别超越滚动 DICE 系数的 CNN 训练中与人类专家感知的相关性

图像与视频处理 2023-05-03 v4 计算机视觉与模式识别

摘要

复杂机器学习任务中优化的度量通常以临时方式选择。它们如何与人类专家感知对齐尚属未知。我们探索了已建立的定量分割质量度量与受过专业训练的人类评分者的定性评估之间的相关性。为此,我们对两个复杂的生物医学语义分割问题进行了心理物理实验。我们发现当前标准度量和损失函数仅与专家的分割质量评估中度相关。重要的是,该效应在临床相关结构(如脑磁共振中胶质瘤的增强肿瘤区以及超声成像中的灰质)上尤为显著。在卷积神经网络(CNN)训练中如何优化诸如人类专家感知等抽象度量通常不明确。为应对此挑战,我们提出一种采用经典统计技术创建互补复合损失函数以更好近似人类专家感知的新策略。在所有评分实验中,人类专家始终将计算机生成的分割评分高于人工标注的参考标签。因此,我们的结果强烈质疑医学图像分割中的许多当前实践,并为未来研究提供有意义的线索。

关键词

引用

@article{arxiv.2103.06205,
  title  = {Are we using appropriate segmentation metrics? Identifying correlates of human expert perception for CNN training beyond rolling the DICE coefficient},
  author = {Florian Kofler and Ivan Ezhov and Fabian Isensee and Fabian Balsiger and Christoph Berger and Maximilian Koerner and Beatrice Demiray and Julia Rackerseder and Johannes Paetzold and Hongwei Li and Suprosanna Shit and Richard McKinley and Marie Piraud and Spyridon Bakas and Claus Zimmer and Nassir Navab and Jan Kirschke and Benedikt Wiestler and Bjoern Menze},
  journal= {arXiv preprint arXiv:2103.06205},
  year   = {2023}
}

备注

Accepted for publication at the Journal of Machine Learning for Biomedical Imaging (MELBA) https://melba-journal.org/2023:002