中文

GlideNet:基于全局、局部与内在特征的密集嵌入网络用于多类别属性预测

计算机视觉与模式识别 2022-03-16 v2 机器学习

摘要

为对象类别附加属性(如颜色、形状、状态、动作)是一个重要的计算机视觉问题。属性预测近期取得了令人振奋的进展,常被表述为多标签分类问题。然而在以下方面仍存在显著挑战:1)在多个类别上预测多样属性,2)建模属性-类别依赖,3)捕获全局与局部场景上下文,4)预测低像素数对象的属性。为解决这些问题,我们提出一种名为GlideNet的新型多类别属性预测深度架构,其包含三个不同的特征提取器。全局特征提取器识别场景中存在的对象,而局部提取器聚焦于感兴趣对象周围的区域。同时,内在特征提取器使用称为知情卷积(Informed Convolution)的标准卷积扩展来检索低像素数对象的特征。GlideNet使用带二值掩码的门控机制及其自学习的类别嵌入来组合密集嵌入。总体上,全局-局部-内在模块理解场景的全局上下文,同时关注局部感兴趣对象的特征。最后,利用组合特征,解释器预测属性,输出长度由类别决定,从而去除不必要的属性。GlideNet在两个近期且具有挑战性的大规模属性预测数据集——VAW和CAR上取得了引人注目的结果。例如,其在平均召回率(mR)指标上比最先进水平高出5%以上。GlideNet的优势在预测低像素数对象的属性以及需要全局上下文理解的属性时尤为明显。最后,我们表明GlideNet在训练匮乏的真实场景中也表现出色。

关键词

引用

@article{arxiv.2203.03079,
  title  = {GlideNet: Global, Local and Intrinsic based Dense Embedding NETwork for Multi-category Attributes Prediction},
  author = {Kareem Metwaly and Aerin Kim and Elliot Branson and Vishal Monga},
  journal= {arXiv preprint arXiv:2203.03079},
  year   = {2022}
}

备注

CVPR 2022, 16 pages (including supplementary), CAR Dataset, VAW Dataset, http://signal.ee.psu.edu/research/glidenet.html