标签清洗多示例学习:在单张全切片图像上精炼粗标注
计算机视觉与模式识别
2022-06-09 v2 机器学习
摘要
在病理样本全切片图像(WSI)中标注癌变区域在临床诊断、生物医学研究和机器学习算法开发中起着关键作用。然而,生成详尽且准确的标注是劳动密集、具有挑战性且昂贵的。仅绘制粗略和近似的标注是一项容易得多的任务,成本更低,并减轻了病理学家的工作负担。在本文中,我们研究在数字病理学中精炼这些近似标注以获得更准确标注的问题。一些先前的工作探索了从这些不准确标注中获取机器学习模型,但极少有工作解决精炼问题,即应显式识别并纠正误标区域,且它们都需要——通常非常大量的——训练样本数。我们提出了一种名为标签清洗多示例学习(LC-MIL)的方法,用于在无需外部训练数据的情况下精炼单张WSI上的粗标注。从带有不准确标签的WSI中裁剪出的图像块在多示例学习框架内联合处理,减轻其对预测模型的影响并精炼分割。我们在包含乳腺癌淋巴结转移、肝癌和结直肠癌样本的异质WSI集合上的实验表明,LC-MIL显著精炼了粗标注,优于最先进的替代方法,即使仅从单张切片学习。此外,我们展示了病理学家绘制的真实标注如何能被所提方法高效地精炼和改进。所有这些结果表明,LC-MIL是一种有前景的轻量工具,可从粗标注的病理集合提供细粒度标注。
引用
@article{arxiv.2109.10778,
title = {Label Cleaning Multiple Instance Learning: Refining Coarse Annotations on Single Whole-Slide Images},
author = {Zhenzhen Wang and Carla Saoud and Sintawat Wangsiricharoen and Aaron W. James and Aleksander S. Popel and Jeremias Sulam},
journal= {arXiv preprint arXiv:2109.10778},
year = {2022}
}