中文

名为何物?超越类索引的图像识别

计算机视觉与模式识别 2024-07-30 v2

摘要

现有机器学习模型在大规模数据集上全监督训练后,于图像物体识别中展现出优异性能。然而,这些模型仅学习将图像映射到预定义的类索引,并未揭示图像中物体的实际语义。相比之下,如CLIP之类的视觉-语言模型能够以“零样本”方式对未见物体赋予语义类名,尽管其在测试时同样被给定一组预定义的候选名称。本文重新考量识别问题,令视觉-语言模型在仅给定大型(基本无约束的)类别词汇表作为先验信息的情况下为图像分配类名。我们利用非参数方法建立图像间有意义的关系,使模型能自动缩小候选名称范围。我们提出的方法包括迭代聚类数据并采用投票机制以确定最合适类名。此外,我们探究了引入额外文本特征以提升聚类性能的潜力。为此,我们使用CLIP视觉与文本编码器从外部数据库检索相关文本,从而为聚类过程提供补充语义信息。进而,我们在无监督与部分监督设定下,以及以粗粒度与细粒度搜索空间作为无约束词典来应对该问题。值得注意的是,在无监督设定下,我们的方法相较ImageNet上的基线取得了约50%的提升。

关键词

引用

@article{arxiv.2304.02364,
  title  = {What's in a Name? Beyond Class Indices for Image Recognition},
  author = {Kai Han and Xiaohu Huang and Yandong Li and Sagar Vaze and Jie Li and Xuhui Jia},
  journal= {arXiv preprint arXiv:2304.02364},
  year   = {2024}
}

备注

CVPR 2024 Workshop on Computer Vision in the Wild