面向显微镜领域的自监督视觉 Transformer 蛋白质定位的泛化
计算机视觉与模式识别
2026-02-09 v2
摘要
任务特定的显微镜数据集往往规模较小,难以训练出具备鲁健特征表示的深度学习模型。自监督学习(SSL)可通过在大规模无标签数据集上进行预训练来缓解此问题,但仍不明确此类表示在不同显微镜领域(具有不同染色方案和通道配置)之间的迁移效果如何。我们针对 OpenCell 数据集上的蛋白质定位任务,检验基于 DINO 预训练的视觉 Transformer 在跨域迁移方面的能力。我们使用三种在 ImageNet-1k、Human Protein Atlas(HPA)以及 OpenCell 上预训练的 DINO 主干网络生成图像嵌入,并在 OpenCell 标签上训练监督分类头进行评估。所有预训练模型都能良好迁移,其中针对显微镜数据的 HPA 预训练模型取得最佳性能(平均宏 -分数 = 0.8221 0.0062),略胜于在 OpenCell 上直接训练的 DINO 模型(0.8057 0.0090)。这些结果凸显了大规模预训练的价值,表明领域相关的 SSL 表示可有效泛化到与之相关但不同构的显微镜数据集,即使在标签数据有限的情况下也能实现卓越的下游性能。
关键词
引用
@article{arxiv.2602.05527,
title = {Generalization of Self-Supervised Vision Transformers for Protein Localization Across Microscopy Domains},
author = {Ben Isselmann and Dilara Göksu and Andreas Weinmann},
journal= {arXiv preprint arXiv:2602.05527},
year = {2026}
}
备注
Preprint; not yet peer reviewed. AMEE Conference Proceeding 2025, 11 pages, 2 figures