巍峨巍峨之巅:视觉基础模型的知识继承
计算机视觉与模式识别
2025-09-16 v2
摘要
视觉基础模型(VFMs)主要通过数据中心方法进行开发。这些方法需要在通常伴随高质量标签的大规模数据上进行训练,这对大多数缺乏大规模数据和高端 GPU 的机构构成瓶颈。另一方面,许多开源视觉模型是在特定领域数据上预训练的,能够提炼并表征可跨越 diverse 应用的核心知识。尽管这些模型极具价值,但在赋能通用 VFMs 开发方面仍 largely 未被探索。本文提出一种新型模型驱动方法,通过联合知识传递与保存来训练 VFMs。我们的方法将多个预训练教师模型统一到共享潜在空间,以缓解其分布差异导致的“不平衡传递”问题。此外,我们引入知识保存策略,将通用教师作为知识库,通过适配器模块集成剩余 purpose-specific 教师的知识。通过统一和聚合现有模型,我们构建了一个 powerful VFM,无需在大规模标记数据上训练,即可继承教师的专业知识。我们的模型不仅提供通用视觉特征,而且天然支持多个下游任务。广泛的实验表明,与现有 data-centric 模型相比,我们的 VFM 在包括图像分类、目标检测、语义和实例分割在内的四项基本视觉任务上均实现了超越性能。
引用
@article{arxiv.2508.14707,
title = {Seeing Further on the Shoulders of Giants: Knowledge Inheritance for Vision Foundation Models},
author = {Jiabo Huang and Chen Chen and Lingjuan Lyu},
journal= {arXiv preprint arXiv:2508.14707},
year = {2025}
}
备注
Technical report