中文

用于检测大规模病理图像偏差和过拟合的开源框架

机器学习 2025-03-04 v1 软件工程 图像与视频处理

摘要

即便是训练于拥有数十亿数据样本的数据集的基础模型,也可能发展出导致过拟合和偏差的捷径。捷径是数据中不相关的模式,如背景颜色或颜色强度。因此,为确保深度学习应用的鲁棒性,亟需方法来检测和消除此类捷径。今天的模型调试方法往往需要耗时且依赖于特定模型架构和特定领域的定制化。我们提出了一个通用、模型无关的框架,用于调试深度学习模型。我们关注病理组织学领域,该领域拥有极大图像,需要大型模型——因此也需要大量计算资源。该框架可在配备常规 GPU 的工作站上运行。我们演示了该框架能够复制先前研究中发现的自监督学习模型的非图像捷径,也识别了基础模型中可能的捷径。我们的易于使用的测试工具有助于开发更可靠、更准确、更具可泛性的 WSIs 分析模型。该框架已作为开源工具发布在 GitHub 上。

关键词

引用

@article{arxiv.2503.01827,
  title  = {Open-source framework for detecting bias and overfitting for large pathology images},
  author = {Anders Sildnes and Nikita Shvetsov and Masoud Tafavvoghi and Vi Ngoc-Nha Tran and Kajsa Møllersen and Lill-Tove Rasmussen Busund and Thomas K. Kilvær and Lars Ailo Bongo},
  journal= {arXiv preprint arXiv:2503.01827},
  year   = {2025}
}