中文

面向领域特定基础模型的视觉指令预训练

计算机视觉与模式识别 2026-02-27 v4

摘要

现代计算机视觉正趋向于一个封闭环路,其中感知、推理与生成相互强化。然而,这一环路仍不完整:高层推理对底层感知特征基础学习的自上而下影响尚未得到充分探索。本文致力于填补这一空白,提出一种新范式,用于在下游领域预训练基础模型。我们引入视觉指令预训练(ViTP),一种新方法,直接利用推理来增强感知。ViTP将Vision Transformer(ViT)主干嵌入到视觉语言模型中,并使用来自目标下游领域精选的丰富视觉指令数据集进行端到端预训练。ViTP由我们提出的视觉鲁棒性学习(VRL)驱动,后者迫使ViT从稀疏视觉token中学习鲁棒且领域相关的特征。在16个具有挑战性的遥感和医学影像基准测试上进行大量实验,表明ViTP在多样化的下游任务上建立了新的最先进(SOTA)性能。代码已公开于 https://github.com/zcablii/ViTP。

关键词

引用

@article{arxiv.2509.17562,
  title  = {Visual Instruction Pretraining for Domain-Specific Foundation Models},
  author = {Yuxuan Li and Yicheng Zhang and Wenhao Tang and Yimian Dai and Ming-Ming Cheng and Xiang Li and Jian Yang},
  journal= {arXiv preprint arXiv:2509.17562},
  year   = {2026}
}