中文

使用基于自监督学习预训练的深度学习模型进行蛋白质定位

计算机视觉与模式识别 2026-04-14 v1

摘要

背景:任务特定的显微镜数据集往往较小,难以训练能够学习鲁健特征的深度学习模型。虽然自监督学习(SSL)通过在大型特定领域数据集上进行预训练显示出前景,但关于不同染色方案和通道配置数据集之间的通用性仍未得到充分探索。我们研究了基于ImageNet-1k和HPA FOV预训练的SSL模型的通用性,评估了它们在OpenCell上的嵌入,包括有无微调两种情况、两种channel-mismatch策略以及不同微调数据比例。我们还分析了在标记的OpenCell子集上的单细胞嵌入。结果:即使在无微调情况下,基于DINO的ViT主干模型预训练于HPA FOV或ImageNet-1k也能良好地迁移到OpenCell。HPA FOV预训练模型实现了最高的零样性能(macro F1F_1 0.822 ±\pm 0.007)。微调后性能提升至0.860 ±\pm 0.013。在单细胞层面,HPA单细胞预训练模型在所有邻域大小下的k近邻性能均最佳(macro F1F_1 \geq 0.796)。结论:SSL方法如DINO,预训练于大型特定领域数据集,可有效地为在小规模任务特定显微镜数据集上进行微调提供深度学习特征。

关键词

引用

@article{arxiv.2604.10970,
  title  = {Using Deep Learning Models Pretrained by Self-Supervised Learning for Protein Localization},
  author = {Ben Isselmann and Dilara Göksu and Heinz Neumann and Andreas Weinmann},
  journal= {arXiv preprint arXiv:2604.10970},
  year   = {2026}
}

备注

29 pages, 8 figures, submitted to BMC Bioinformatics. arXiv admin note: text overlap with arXiv:2602.05527