中文

基于异构且部分标注图像数据集的深度学习宫颈模型构建

机器学习 2022-01-19 v1 人工智能

摘要

宫颈癌是全球女性第四常见的癌症。一个鲁棒的自动化宫颈图像分类系统可弥补临床医护人员在传统醋酸白视觉检查(VIA)中的局限性。然而,宫颈检查目标种类繁多,影响了针对特定标准的预测模型开发的标注准则。此外,由于缺乏确诊检测结果及标注者间差异,许多图像未被标注。受这些挑战驱动,我们提出一种基于自监督学习(SSL)的方法,从未标注宫颈图像中生成预训练的宫颈模型。该模型进一步微调,利用可用标注图像生成针对特定准则的分类模型。我们利用两个宫颈图像数据集证明了所提方法的有效性。两个数据集均部分标注且标注准则不同。实验结果表明,基于 SSL 的初始化提升了分类性能(准确率至少提升 2.5%),且在 SSL 期间纳入两个数据集的图像进一步提升了性能(准确率至少提升 1.5%)。进一步,考虑到数据共享限制,我们验证了联邦 SSL 的有效性,发现其相对于仅用自身图像开发的 SSL 模型能提升性能。这印证了基于 SSL 的宫颈模型构建的重要性。我们相信本研究通过结合来自不同来源、未标注和/或按不同准则标注的图像,并解决图像访问限制,为开发针对特定准则的定制深度宫颈图像分类模型展示了新方向。

关键词

引用

@article{arxiv.2201.07013,
  title  = {Deep Cervix Model Development from Heterogeneous and Partially Labeled Image Datasets},
  author = {Anabik Pal and Zhiyun Xue and Sameer Antani},
  journal= {arXiv preprint arXiv:2201.07013},
  year   = {2022}
}

备注

5 Pages