深度学习模型用于图像分析的性能评估:视觉控制与统计指标的考量
计算机视觉与模式识别
2026-03-17 v1
摘要
深度学习基于图像的自动化分析 (DL-AIA) 已被证明优于训练有素的病理学家,在与特征定量化相关的任务中发挥作用。与这些能力相关的是,DL-AIA工具的使用正在从原型研究扩展到常规应用,例如患者样本(诊断病理学)、监管安全评估(毒理学病理学)以及反复研究任务。为确保DL-AIA应用安全可靠,关键在于进行彻底且客观的概括性能评估(即算法准确预测感兴趣模式的能力),并可能评估模型鲁棒性(即算法在来自不同来源的图像上维持预测准确性的能力)。本文回顾了兽医病理学出版物中进行性能评估的做法,确定了两种方法:1)专门的视觉性能控制(即 eyeballing 算法预测)加上验证模型应用利用次要性能指数,以及2)统计性能控制(以及其他方法),需要在模型训练前创建数据集并分离出保留测试集。本文比较了统计和视觉性能控制方法的优缺点。此外,我们讨论了严格统计性能评估的相关考量,包括指标选择、测试数据集图像组成、ground truth标签质量、抽样方法如自助助理、多个模型的统计比较以及模型稳定性的评估。我们得出结论,视觉和统计评估具有互补的优势,两者结合提供了对DL模型性能及错误来源的最佳见解。
引用
@article{arxiv.2603.13557,
title = {Performance evaluation of deep learning models for image analysis: considerations for visual control and statistical metrics},
author = {Christof A. Bertram and Jonas Ammeling and Alexander Bartel and Gillian Beamer and Marc Aubreville},
journal= {arXiv preprint arXiv:2603.13557},
year = {2026}
}