中文

视觉语言模型在光学显微镜少样本细胞检测中的上下文自适应

计算机视觉与模式识别 2025-11-11 v1 人工智能

摘要

基础视觉语言模型(VLM)在自然图像上表现优异,但其在生物医学显微镜领域的应用仍有待深入探索。本文研究了在缺乏大规模标注数据集(这在显微镜图像中很常见)的情况下,上下文学习如何使最先进的 VLM 执行少样本目标检测。我们引入了 Micro-OD 基准,这是一个包含 252 张图像的精选集合,专门为上下文学习而策划,其边界框标注涵盖了来自四个数据源的 11 种细胞类型,包括两个实验室内的专家标注集。我们在少样本条件下系统评估了八种 VLM,并比较了带有和不带有隐式测试时推理 token 的变体。我们进一步实现了一个混合的少样本目标检测(FSOD)流水线,将检测头与基于 VLM 的少样本分类器相结合,增强了最新 VLM 在我们基准上的少样本性能。跨数据集观察表明,由于领域差距,零样本性能较弱;然而,少样本支持持续改善了检测效果,在六次样本之后增益趋于平缓。我们观察到,带有推理 token 的模型在端到端定位中更有效,而较简单的变体更适合对预定位的裁剪图像进行分类。我们的结果突出了上下文自适应作为显微镜领域的一种实用路径,并且我们的基准为推进生物医学图像中的开放词汇检测提供了可复现的测试平台。

关键词

引用

@article{arxiv.2511.05565,
  title  = {In-Context Adaptation of VLMs for Few-Shot Cell Detection in Optical Microscopy},
  author = {Shreyan Ganguly and Angona Biswas and Jaydeep Rade and Md Hasibul Hasan Hasib and Nabila Masud and Nitish Singla and Abhipsa Dash and Ushashi Bhattacharjee and Aditya Balu and Anwesha Sarkar and Adarsh Krishnamurthy and Soumik Sarkar},
  journal= {arXiv preprint arXiv:2511.05565},
  year   = {2025}
}