用于可靠表征评分者间不确定性的标签融合与训练方法
图像与视频处理
2023-01-13 v3 计算机视觉与模式识别
摘要
由于图像质量、专业经验与培训或指南清晰度等多重因素,医学任务易出现评分者间变异性。使用多位评分者的标注训练深度学习网络是常见做法,可减轻模型对单一专家的偏倚。生成经校准输出并反映评分者间分歧的可靠模型,是人工智能融入临床实践的关键。现有多种方法用于考虑不同专家的标签。我们重点比较三种标签融合方法:STAPLE、评分者分割结果的平均,以及训练期间对各评分者分割结果的随机采样。每种标签融合方法均使用常规训练框架与近期发表的 SoftSeg 框架进行研究,后者通过将分割任务视为回归来限制信息损失。我们在两个公开数据集上跨越 10 种数据划分的结果表明,无论真值融合方法如何,SoftSeg 模型相较其常规对应模型具有更好的校准与评分者间变异性保持,且不影响分割性能。常规模型(即以 Dice 损失训练、二值输入、sigmoid/softmax 最终激活)过于自信,并低估了与评分者间变异性相关的不确定性。反之,通过平均融合标签并结合 SoftSeg 框架导致输出欠自信,并高估了评分者分歧。在分割性能方面,两个所研究数据集的最佳标签融合方法不同,表明该参数可能依赖于任务。然而,SoftSeg 的分割性能系统性地优于或等于常规训练模型,并具有最佳的校准与评分者间变异性保持。
引用
@article{arxiv.2202.07550,
title = {Label fusion and training methods for reliable representation of inter-rater uncertainty},
author = {Andreanne Lemay and Charley Gros and Enamundram Naga Karthik and Julien Cohen-Adad},
journal= {arXiv preprint arXiv:2202.07550},
year = {2023}
}
备注
Accepted for publication at the Journal of Machine Learning for Biomedical Imaging (MELBA) https://www.melba-journal.org/papers/2022:031.html