中文

Franca:面向可扩展视觉表征学习的嵌套 Matryoshka 聚类

计算机视觉与模式识别 2026-04-28 v4

摘要

我们提出 Franca(发音为 Fran-ka):free one——首个完全开源(数据、代码、权重)视觉基础模型,其性能匹配甚至在许多方面超过了领先的专有模型,如 DINOv2、CLIP、SigLIPv2 等。我们的做法灵感来自 Web-SSL,使用公开可用的数据:ImageNet-21K 和 ReLAION-2B 的子集。除了模型发布之外,我们解决了 SSL 聚类方法的关键局限性。虽然现代模型依赖于将图像特征分配给大型词表表(codebook)的聚类算法(如 Sinkhorn-Knopp),但未能考虑聚类语义的内在歧义性。为此,我们引入一种基于嵌套 Matryoshka 表示的参数高效、多头聚类投影器。该设计在不增加模型规模的情况下,逐步细化特征到越来越细粒度的聚类,从而实现性能和内存效率的平衡。此外,我们提出一种新颖的位置无缝解耦策略,显式地从稠密表征中移除位置偏差,从而改进语义内容的编码。这导致在多个下游基准测试上实现持续的性能提升,表明更干净的特征空间具有实用性。我们的贡献为透明、高性能的视觉模型树立了新标准,为更广泛的 AI 社区奠定了可重复性和通用性更强的基础模型之路。代码和模型检查点可在 https://github.com/valeoai/Franca 获取。

关键词

引用

@article{arxiv.2507.14137,
  title  = {Franca: Nested Matryoshka Clustering for Scalable Visual Representation Learning},
  author = {Shashanka Venkataramanan and Valentinos Pariza and Mohammadreza Salehi and Lukas Knobel and Spyros Gidaris and Elias Ramzi and Andrei Bursuc and Yuki M. Asano},
  journal= {arXiv preprint arXiv:2507.14137},
  year   = {2026}
}