中文

使用大型视觉模型提升长尾数据中的特征

计算机视觉与模式识别 2026-02-09 v3

摘要

语言基础模型,如大型语言模型(LLM)或大型视觉-语言模型(LVM),已在长尾识别中广泛受到关注。然而,语言数据的需求并非适用于所有实际任务。本研究旨在探索使用大型视觉模型(LVM)或视觉基础模型(VFM)在不包含任何语言信息的情况下增强长尾数据特征。具体而言,我们从 LVM 中提取特征,并与基线网络的 map 和潜在空间中的特征融合,以获得增强后的特征。此外,我们设计了若干基于原型的损失函数,以进一步利用增强特征的潜力。在实验部分,我们在两个基准数据集上验证了该方法:ImageNet-LT 和 iNaturalist2018。

关键词

引用

@article{arxiv.2504.10852,
  title  = {Enhancing Features in Long-tailed Data Using Large Vision Model},
  author = {Pengxiao Han and Changkun Ye and Jinguang Tong and Cuicui Jiang and Jie Hong and Li Fang and Xuesong Li},
  journal= {arXiv preprint arXiv:2504.10852},
  year   = {2026}
}