面向监督深度学习的显微图像分析数据集创建——重要考量与建议综述
计算机视觉与模式识别
2025-12-05 v1
摘要
监督式深度学习(DL)因其在自动化显微图像分析中的潜力,受到广泛关注。该领域的DL模型开发与验证严重依赖高质量、大规模数据集的 availability。然而,数据集的创建是一个复杂且资源密集型的过程,常因时间限制、领域变异性以及图像收集与标注创建过程中的偏风险而受到阻碍。本综述提供了数据集创建关键步骤的全面指南,包括:1)图像获取、2)标注软件的选择、3)标注创建。除了确保足够数量的图像外,还必须解决图像变异性(领域迁移)的来源——例如与片层准备和数字化相关——以防止训练数据中未充分代表性而导致算法错误。标注的关键质量标准是三个“C”值:正确性、完整性和一致性。本综述探讨了通过采用先进技术来提高标注质量的方法,这些技术缓解了单一标注员局限性。为支持数据集创建者,本文提供了作为补充材料的标准操作程序(SOP),概述了数据集开发的最佳实践。此外,本文强调了开放数据集在推动创新和提高DL研究可重复性方面的重要性。通过解决挑战并提供实用建议,本综述旨在推动高质量大规模数据集的创建与可用性,从而促进面向病理学应用的通用且稳健的DL模型的发展。
引用
@article{arxiv.2512.04564,
title = {Dataset creation for supervised deep learning-based analysis of microscopic images -- review of important considerations and recommendations},
author = {Christof A. Bertram and Viktoria Weiss and Jonas Ammeling and F. Maria Schabel and Taryn A. Donovan and Frauke Wilm and Christian Marzahl and Katharina Breininger and Marc Aubreville},
journal= {arXiv preprint arXiv:2512.04564},
year = {2025}
}