中文

基于对比多模态图像表示的跨模态子图像检索

计算机视觉与模式识别 2023-03-21 v2

摘要

在组织表征与癌症诊断中,多模态成像已成为一种强有力的技术。得益于计算进展,可利用大型数据集发现病理中的模式并改善诊断。然而,这需要高效且可扩展的图像检索方法。跨模态图像检索尤其具有挑战性,因为由不同模态捕获的相似(甚至相同)内容图像可能共有极少共同结构。我们提出了一种新的与应用无关、基于内容的图像检索(CBIR)系统,用于跨模态的反向(子)图像搜索,该系统结合深度学习生成表示(将不同模态嵌入公共空间)与经典特征提取和词袋模型,以实现高效可靠的检索。我们通过替换研究展示了其优势,探索了若干特征提取器与学习到的表示,并与近期(跨模态)CBIR方法进行比较。在(公开可用的)明场与第二谐波生成显微镜图像数据集上的(子)图像检索任务中,结果表明我们的方法优于所有测试的替代方案。我们讨论了所比较方法的不足,并观察到学习到的表示与特征提取器在CBIR流程中等变与不变性质的重要性。代码见:\url{https://github.com/MIDA-group/CrossModal_ImgRetrieval}。

关键词

引用

@article{arxiv.2201.03597,
  title  = {Cross-Modality Sub-Image Retrieval using Contrastive Multimodal Image Representations},
  author = {Eva Breznik and Elisabeth Wetzer and Joakim Lindblad and Nataša Sladoje},
  journal= {arXiv preprint arXiv:2201.03597},
  year   = {2023}
}