中文

跨模态学习用于浮游植物识别

计算机视觉与模式识别 2026-04-20 v2

摘要

本文考虑将自监督跨模态协调作为策略,以利用多个模态和大量未标记浮游植物数据构建浮游植物识别模型。自动化成像仪器 facilitate 持续大规模收集浮游植物图像数据。当前的自动浮游植物图像识别方法主要依赖监督方法,这些方法需要标记的训练集,标记工作量大。另一方面,一些现代浮游植物成像仪器还为图像信息提供光学测量数据,如散射和荧光轮廓,这些数据目前在浮游植物识别中并未得到广泛利用。本文探索了利用此类测量数据在无需手动标记的情况下指导学习过程的可能性。灵感来自对比语言-图像预训练(CLIP)的概念,我们仅使用指示给定图像和轮廓是否来自同一颗粒或不同颗粒的二进制监督信息来训练两个模态的编码器。对于浮游植物识别,我们采用少量已知浮游植物物种的标记画廊,结合 kk-NN 分类器。该方法构建的识别模型具有内在的多模态特性,即能够利用从图像和轮廓数据中提取的双重信息。我们展示,该方法在仅需极少标记图像的情况下即可实现高识别准确率。此外,我们还表明该方法优于仅使用图像的自监督基线方法。代码地址:https://github.com/Jookare/cross-modal-plankton

关键词

引用

@article{arxiv.2603.16427,
  title  = {Cross-modal learning for plankton recognition},
  author = {Joona Kareinen and Veikka Immonen and Tuomas Eerola and Lumi Haraguchi and Lasse Lensu and Kaisa Kraft and Sanna Suikkanen and Heikki Kälviäinen},
  journal= {arXiv preprint arXiv:2603.16427},
  year   = {2026}
}