中文

SOTA:面向多Foundation模型的自适应最优传输零样本分类

计算机视觉与模式识别 2026-03-13 v3

摘要

Foundation模型因其强大的零样本分类能力而在多个领域获得广泛关注。本工作受到两个关键观察结果驱动:(1)视觉-语言模型(VLM,如CLIP)常过度依赖类别级文本先验,难以捕获细粒度视觉线索;而视觉-only Foundation模型(VFM,如DINO)提供丰富且具辨别力的视觉特征,但缺乏语义对齐;(2)不同VLM在不同数据集上的性能差异显著,源于预训练差异。为此,我们提出\textbf{SOTA}(\textit{Self-adaptive Optimal TrAnsport}),一个\textit{训练无关}的集成框架,通过学习自适应传输方案整合多个Foundation模型的输出(VFM或VLM)。值得注意的是,\textbf{SOTA}无需先验假设,能自动平衡各模型贡献。跨多个领域的大量实验(包括自然图像、医学病理和遥感等)验证了\textbf{SOTA}的通用性。结果一致显示,它有效利用不同Foundation模型的互补优势,显著超越单个模型。实现代码已公开:https://github.com/Afleve/self-adaptive-Optimal-Transport。

关键词

引用

@article{arxiv.2506.13723,
  title  = {SOTA: Self-adaptive Optimal Transport for Zero-Shot Classification with Multiple Foundation Models},
  author = {Zhanxuan Hu and Qiyu Xu and Yu Duan and Yonghang Tai and Huafeng Li},
  journal= {arXiv preprint arXiv:2506.13723},
  year   = {2026}
}