中文

基于难负样本挖掘的超声视频图像表示无监督对比学习

图像与视频处理 2022-07-28 v1 计算机视觉与模式识别

摘要

丰富的时间信息与视角变化使得视频数据成为利用无监督对比学习(UCL)技术学习图像表示的一个有吸引力的选择。最先进的(SOTA)对比学习技术将同一视频内的帧视为嵌入空间中的正样本,而将其他视频的帧视为负样本。我们观察到,与自然场景视频中物体的多视角不同,超声(US)视频捕捉的是器官的不同二维切片。因此,即便是同一段超声视频中时间上相距较远的帧之间也几乎不存在相似性。本文中我们提议转而将此类帧用作难负样本。我们倡导在UCL框架中,以硬度敏感的负样本挖掘课程来挖掘视频内与跨视频的负样本,以学习丰富的图像表示。我们将该框架部署于从超声视频中学习胆囊(GB)恶性的表示。我们还构建了首个大规模超声视频数据集,包含64段视频与15,800帧,用于学习GB表示。我们表明,采用我们的框架训练的标准ResNet50骨干网络,在GB恶性检测任务上,相较基于SOTA UCL技术预训练的模型以及ImageNet上监督预训练的模型,将准确率提升了2-6%。我们进一步在公开的COVID-19肺部超声图像数据集上验证了方法的泛化性,并显示出相较SOTA提升1.5%。源代码、数据集与模型见 https://gbc-iitd.github.io/usucl。

关键词

引用

@article{arxiv.2207.13148,
  title  = {Unsupervised Contrastive Learning of Image Representations from Ultrasound Videos with Hard Negative Mining},
  author = {Soumen Basu and Somanshu Singla and Mayank Gupta and Pratyaksha Rana and Pankaj Gupta and Chetan Arora},
  journal= {arXiv preprint arXiv:2207.13148},
  year   = {2022}
}

备注

ACCEPTED for publication at MICCAI 2022