SOTA:面向多Foundation模型的自适应最优传输零样本分类
计算机视觉与模式识别
2026-03-13 v3
摘要
Foundation模型因其强大的零样本分类能力而在多个领域获得广泛关注。本工作受到两个关键观察结果驱动:(1)视觉-语言模型(VLM,如CLIP)常过度依赖类别级文本先验,难以捕获细粒度视觉线索;而视觉-only Foundation模型(VFM,如DINO)提供丰富且具辨别力的视觉特征,但缺乏语义对齐;(2)不同VLM在不同数据集上的性能差异显著,源于预训练差异。为此,我们提出\textbf{SOTA}(\textit{Self-adaptive Optimal TrAnsport}),一个\textit{训练无关}的集成框架,通过学习自适应传输方案整合多个Foundation模型的输出(VFM或VLM)。值得注意的是,\textbf{SOTA}无需先验假设,能自动平衡各模型贡献。跨多个领域的大量实验(包括自然图像、医学病理和遥感等)验证了\textbf{SOTA}的通用性。结果一致显示,它有效利用不同Foundation模型的互补优势,显著超越单个模型。实现代码已公开:https://github.com/Afleve/self-adaptive-Optimal-Transport。
关键词
引用
@article{arxiv.2506.13723,
title = {SOTA: Self-adaptive Optimal Transport for Zero-Shot Classification with Multiple Foundation Models},
author = {Zhanxuan Hu and Qiyu Xu and Yu Duan and Yonghang Tai and Huafeng Li},
journal= {arXiv preprint arXiv:2506.13723},
year = {2026}
}