通过保留其他变化因素学习物体识别
计算机视觉与模式识别
2017-01-24 v3
摘要
自然图像是在许多因素下生成的,包括形状、姿态、光照等。大多数现有的ConvNets将自然图像的物体识别表述为单任务分类问题,并试图学习对物体类别有用的特征,同时对其他变化因素尽可能保持不变。这些架构没有显式地学习其他因素(如姿态和光照),相反,它们通常通过池化和归一化将其丢弃。在这项工作中,我们采取相反的方法:我们通过保留其他因素(在我们的例子中是姿态)来训练ConvNets进行物体识别,并将它们与物体类别联合学习。我们设计了一种新的多任务学习(MTL)ConvNet,命名为解耦CNN(disCNN),它显式地强制物体身份和姿态的解耦表示,并被训练以预测物体类别和姿态变换。我们表明,在iLab-20M数据集(一个带有详细物体姿态和光照信息的大规模转台数据集)上,disCNN比仅训练用于预测物体类别的AlexNet获得了显著更好的物体识别准确率。我们进一步表明,在iLab-20M上预训练的disCNN/AlexNet特征可泛化到Washington RGB-D和ImageNet数据集上的物体识别,并且对于在ImageNet数据集上微调物体识别,预训练的disCNN特征显著优于预训练的AlexNet特征。
引用
@article{arxiv.1607.05851,
title = {Learning to Recognize Objects by Retaining other Factors of Variation},
author = {Jiaping Zhao and Chin-kai Chang and Laurent Itti},
journal= {arXiv preprint arXiv:1607.05851},
year = {2017}
}
备注
9 pages, accepted by WACV 2017