flexgrid2vec:学习高效的视觉表示向量
计算机视觉与模式识别
2021-09-30 v6
摘要
我们提出flexgrid2vec,一种用于图像表示学习的新方法。现有的视觉表示方法存在若干问题,包括需要高度密集的计算、丢失深层结构信息的风险,以及方法对特定形状或物体的专一性。flexgrid2vec将图像转换为低维特征向量。我们用具有灵活唯一节点位置和边距离的图来表示每幅图像。flexgrid2vec是一个多通道GCN,学习最具代表性图像块的特征。我们研究了GCN节点嵌入的谱与非谱实现。具体而言,我们基于不同的节点聚合方法实现了flexgrid2vec,如向量求和、拼接以及基于特征向量中心性的归一化。我们在二分类和多分类图像分类任务上将flexgrid2vec与一组最先进的视觉表示学习模型进行比较。尽管我们使用不平衡、小规模和低分辨率的数据集,flexgrid2vec相对于知名基分类器表现出稳定且出色的结果。flexgrid2vec在CIFAR-10上达到96.23%,在CIFAR-100上达到83.05%,在STL-10上达到94.50%,在ASIRRA上达到98.8%,在COCO数据集上达到89.69%。
引用
@article{arxiv.2007.15444,
title = {flexgrid2vec: Learning Efficient Visual Representations Vectors},
author = {Ali Hamdi and Du Yong Kim and Flora D. Salim},
journal= {arXiv preprint arXiv:2007.15444},
year = {2021}
}
备注
13 pages