中文

视觉基础模型是否为电子显微镜图像分割奠定基础?

计算机视觉与模式识别 2026-02-10 v1

摘要

尽管视觉基础模型(VFMs)日益被重用于生物医学图像分析,但其提供的隐式表征是否足够通用,以支持跨异构显微镜图像数据集的有效迁移与重用仍不明确。本文针对电子显微镜(EM)图像中线粒体分割问题进行研究,采用两个流行的公开 EM 数据集(Lucchi++ 和 VNC)以及三个最新代表性 VFMs(DINOv2、DINOv3 和 OpenCLIP)。我们评估了两种实际的模型适应方案:一种是冻结主干网络,只在其上方训练轻量级分割头;另一种是通过低秩适应(LoRA)进行参数高效微调,在特定数据集上针对性地微调 VFM。在所有主干网络上观察到,单一 EM 数据集上的训练即可获得良好的分割性能(以前景交并比衡量),LoRA 在领域内性能持续提升。相比之下,多数据集训练导致所有模型严重性能下降,PEFT 仅带来有限提升。通过多种技术探索隐式表征空间(包括 PCA、Fréchet Dinov2 距离和线性探针),我们发现尽管两数据集在视觉上高度相似,但仍存在显著且持久的领域不匹配,这与配对训练的失败相符。这些结果表明,尽管 VFMs 可在轻量适应下为 EM 分割提供竞争性能,但当前 PEFT 策略尚不足以在无需额外域对齐机制的情况下获得跨异构 EM 数据集的单一稳健模型。

关键词

引用

@article{arxiv.2602.08505,
  title  = {Are Vision Foundation Models Foundational for Electron Microscopy Image Segmentation?},
  author = {Caterina Fuster-Barceló and Virginie Uhlmann},
  journal= {arXiv preprint arXiv:2602.08505},
  year   = {2026}
}