中文

在低数据量场景下适配通用基础模型以用于 X 射线叠层成像

计算机视觉与模式识别 2025-12-17 v2

摘要

先进显微学中工作流的自动化是一个关键目标,其中语言模型(LLM)和视觉语言模型(VLM)等基础模型展现出巨大潜力。然而,将这些通用模型适配于专业科学任务至关重要,且最佳的领域适配策略往往不明确。为解决此问题,我们引入了 PtychoBench,一个用于叠层成像分析的多模态、多任务基准。使用该基准,我们系统比较了两种专业化策略:监督微调(SFT)和上下文学习(ICL)。我们在数据稀缺场景下,评估了 VLM 在视觉伪影检测任务和 LLM 在文本参数推荐任务上的这些策略。我们的发现表明,最佳的专业化路径依赖于具体任务。对于视觉任务,SFT 和 ICL 高度互补,由上下文感知示例引导的微调模型实现了最高的平均性能(Micro-F1 为 0.728)。相反,对于文本任务,在大型基础模型上进行 ICL 是更优策略,达到 0.847 的峰值 Micro-F1,并优于强大的“超级专家”SFT 模型(0-shot Micro-F1 为 0.839)。我们还确认了上下文感知提示的优越性,并发现了微调模型中一致的上下文干扰现象。这些结果与包括 GPT-4o 和基于 DINOv3 的分类器在内的强基线进行了对比,为科学领域的人工智能提供了关键观察:我们基准中的最佳专业化路径取决于任务模态,为开发更有效的科学智能体系统提供了清晰的框架。

关键词

引用

@article{arxiv.2511.02503,
  title  = {Adapting General-Purpose Foundation Models for X-ray Ptychography in Low-Data Regimes},
  author = {Robinson Umeike and Neil Getty and Yin Xiangyu and Yi Jiang},
  journal= {arXiv preprint arXiv:2511.02503},
  year   = {2025}
}