通过残差卷积网络隐藏层的可扩展视觉属性提取
计算机视觉与模式识别
2021-04-02 v1
摘要
视觉属性在基于图像检索的实际应用中起着至关重要的作用。例如,从图像中提取属性可使电子商务搜索引擎产生更高精度的检索结果。构建属性提取器的传统方式是用固定数量的类别训练基于卷积网络(convnet)的分类器。然而,这种方法对于属性数量频繁变化的实际应用而言不可扩展。因此,在这项工作中,我们提出一种从图像中提取视觉属性的方法,利用通用卷积网络隐藏层已学习到的区分不同视觉特征的能力。我们使用在 Imagenet 上训练的 resnet-50 进行实验,评估其不同块的输出以区分颜色和纹理。我们的结果表明,resnet 的第二块适用于区分颜色,而第四块可用于纹理。在这两种情况下,属性分类的准确率均超过 93%。我们还表明所提出的嵌入(embeddings)在底层特征空间中形成局部结构,这使得可以应用如 UMAP 等降维技术,在保持高准确率的同时大幅缩减特征空间的大小。
引用
@article{arxiv.2104.00161,
title = {Scalable Visual Attribute Extraction through Hidden Layers of a Residual ConvNet},
author = {Andres Baloian and Nils Murrugarra-Llerena and Jose M. Saavedra},
journal= {arXiv preprint arXiv:2104.00161},
year = {2021}
}
备注
8 pages