中文

用语言描述细胞构筑:用于人脑显微镜检查的弱监督视觉语言建模

计算机视觉与模式识别 2026-02-27 v1

摘要

基础模型日益展现出支持交互式、智能体工作流的潜力,这些工作流可协助研究人员分析和解释图像数据。此类工作流通常需要将视觉与语言耦合以提供自然语言界面。然而,在许多研究和临床环境中,学习这种耦合所需的配对图像-文本数据是稀缺且难以获得的。其中一个场景是对细胞体染色的组织学人脑切片进行显微镜分析,这能够研究细胞构筑:细胞密度和形态及其层状和区域组织。在这里,我们提出了一种标签介导的方法,通过仅通过标签连接图像和文本来从图像生成有意义的标题,而无需精心策划的配对图像-文本数据。给定标签,我们自动从相关文献中挖掘区域描述,并将其用作反映典型细胞构筑属性的合成标题。然后,通过图像到文本的训练目标,将现有的细胞构筑视觉基础模型(CytoNet)与大型语言模型耦合,使得显微镜区域能够用自然语言描述。跨越57个脑区,所得方法产生了合理的区域级描述,并通过明确拒绝未见区域支持开放集使用。对于范围内的补丁,它以90.6%的准确率匹配细胞构筑参考标签,并且在区域标签被掩盖的情况下,其描述仍具有足够的区分度,在8路测试中以68.6%的准确率恢复区域。这些结果表明,弱的、标签介导的配对可能足以将现有的生物医学视觉基础模型与语言连接起来,为在细粒度配对注释稀缺的领域集成自然语言提供了一种实用的方法。

关键词

引用

@article{arxiv.2602.23088,
  title  = {Cytoarchitecture in Words: Weakly Supervised Vision-Language Modeling for Human Brain Microscopy},
  author = {Matthew Sutton and Katrin Amunts and Timo Dickscheid and Christian Schiffer},
  journal= {arXiv preprint arXiv:2602.23088},
  year   = {2026}
}

备注

8 pages, 3 figures, submitted for inclusion at a conference