生物医学图像复合图分离:挖掘大规模数据集用于自监督学习
摘要
随着自监督学习(如对比学习)的快速发展,在医学图像分析中,拥有大规模图像(即使无标注)以训练更具泛化性的 AI 模型的重要性已得到广泛认可。然而,对于单个实验室而言,大规模收集特定任务的无标注数据可能具有挑战性。现有的在线资源,如数字图书、出版物与搜索引擎,为获取大规模图像提供了新途径。但是,医疗领域(如放射学与病理学)已发布的图像包含大量带子图的复合图。为将复合图提取并分离为可用于下游学习的独立图像,我们提出了一种简单的复合图分离(SimCFS)框架,无需传统所需的检测边界框标注,并引入了新的损失函数与难例模拟。我们的技术贡献有四点:(1)我们引入了基于模拟的训练框架,将资源密集的边界框标注需求降至最低;(2)我们提出了一种针对复合图分离优化的新侧损失(side loss);(3)我们提出了一种类内图像增强方法以模拟难例;(4)据我们所知,这是首个评估利用复合图分离进行自监督学习有效性的研究。结果表明,所提出的 SimCFS 在 ImageCLEF 2016 复合图分离数据库上取得了最先进的性能。使用大规模挖掘图像预训练的自监督学习模型通过对比学习算法提升了下游图像分类任务的准确率。SimCFS 的源代码已公开于 https://github.com/hrlblab/ImageSeperation。
引用
@article{arxiv.2208.14357,
title = {Compound Figure Separation of Biomedical Images: Mining Large Datasets for Self-supervised Learning},
author = {Tianyuan Yao and Chang Qu and Jun Long and Quan Liu and Ruining Deng and Yuanhan Tian and Jiachen Xu and Aadarsh Jha and Zuhayr Asad and Shunxing Bao and Mengyang Zhao and Agnes B. Fogo and Bennett A. Landman and Haichun Yang and Catie Chang and Yuankai Huo},
journal= {arXiv preprint arXiv:2208.14357},
year = {2022}
}
备注
Accepted for publication at the Journal of Machine Learning for Biomedical Imaging (MELBA) https://www.melba-journal.org/papers/2022:025.html. arXiv admin note: substantial text overlap with arXiv:2107.08650