BioCAP:利用生物学基础模型中的合成描述性标题
计算机视觉与模式识别
2026-03-03 v3 计算与语言
机器学习
摘要
本工作探讨将描述性标题作为生物学多模态基础模型的额外监督来源。图像与标题可视为来自物种潜在形态空间的互补样本,分别捕获某些生物学特征。将标题纳入训练过程中可鼓励与该共享潜在结构对齐,强调可能具有诊断意义的特征,同时抑制虚假关联。主要挑战在于获得大规模的忠实且特定于实例的标题。这一要求限制了自然语言监督在生物学领域的利用,相较于许多其他科学领域而言。我们通过利用维基百科衍生的视觉信息和科 taxon-定制化格式示例,引导多模态大语言模型(MLLM)生成合成标题。这些领域特定的上下文有助于减少幻觉并产生准确的、基于实例的描述性标题。利用这些标题,我们训练了BioCAP(即带标题的 BioCLIP),构建的生物学基础模型能够捕获丰富的语义并在物种分类和文本-图像检索中实现卓越的性能。这些结果表明,除了标签之外的描述性标题在桥接生物学图像与多模态基础模型方面具有重要价值。
引用
@article{arxiv.2510.20095,
title = {BioCAP: Exploiting Synthetic Captions Beyond Labels in Biological Foundation Models},
author = {Ziheng Zhang and Xinyue Ma and Arpita Chowdhury and Elizabeth G. Campolongo and Matthew J. Thompson and Net Zhang and Samuel Stevens and Hilmar Lapp and Tanya Berger-Wolf and Yu Su and Wei-Lun Chao and Jianyang Gu},
journal= {arXiv preprint arXiv:2510.20095},
year = {2026}
}
备注
ICLR 2026; Project page: https://imageomics.github.io/biocap/