中文

FineViT:通过稠密再描述逐步解锁细粒度感知

计算机视觉与模式识别 2026-03-19 v1

摘要

尽管多模态大语言模型(MLLM)经历了快速发展,其视觉编码器常常成为性能瓶颈。传统的CLIP式编码器由于低分辨率预训练和依赖噪声、粗糙的网页爬取图像-文本对,难以处理稠密空间任务。为克服这些限制,我们提出FineViT,一种专为解锁细粒度感知而设计的新型视觉编码器。通过用稠密再描述取代粗糙网页数据,我们系统性地通过分阶段训练范式缓解信息损失:首先,在数十亿全球再描述图像-文本对上以高分辨率从头训练编码器,建立稳健且充满细节的语义基础;随后,我们利用我们精选的FineCap-450M数据集进行进一步的局部感知增强,该数据集包含超过4.5亿高质量局部描述。广泛的实验验证了分阶段策略的有效性。FineViT在零样本识别和检索方面实现了最先进的性能,尤其在长上下文检索方面,持续优于集成到MLLM中的SigLIP2和Qwen-ViT等多模态视觉编码器。我们希望FineViT能作为细粒度视觉感知的强大新基准。

关键词

引用

@article{arxiv.2603.17326,
  title  = {FineViT: Progressively Unlocking Fine-Grained Perception with Dense Recaptions},
  author = {Peisen Zhao and Xiaopeng Zhang and Mingxing Xu and Ruoyu Sun and Zewei Du and Dunzheng Wang and Guanghao Zheng and Haohang Xu and Zhibo Zhang and Yuhang Zhang and Yi Ai and Lin Liu and Qi Tian},
  journal= {arXiv preprint arXiv:2603.17326},
  year   = {2026}
}