用于图像分类的非iid图像模型的近似Fisher核
计算机视觉与模式识别
2016-05-30 v1 机器学习
摘要
词袋(BoW)模型将图像视为局部描述子的集合,并用视觉词直方图表示它们。Fisher向量(FV)表示扩展了BoW,考虑了局部描述子的一阶和二阶统计量。在这两种表示中,局部描述子被假定为独立同分布(iid),从建模角度看这是一个糟糕的假设。实验观察到,采用诸如幂次归一化之类的折扣变换可以改进BoW和FV表示的性能。在本文中,我们通过将模型参数视为被积分掉的潜变量来引入非iid模型,从而使所有局部区域相互依赖。利用Fisher核原理,我们用数据对数似然关于模型超参数的梯度来编码图像。我们的模型在表示中自然产生折扣效应;这表明此类变换之所以成功,是因为它们与为非iid模型获得的表示紧密对应。为了实现易于处理的计算,我们依赖变分自由能界限来学习超参数并计算近似Fisher核。我们的实验评估结果验证了我们的模型带来的性能提升可与最先进特征聚合方法中采用的幂次归一化相媲美。
引用
@article{arxiv.1510.00857,
title = {Approximate Fisher Kernels of non-iid Image Models for Image Categorization},
author = {Ramazan Gokberk Cinbis and Jakob Verbeek and Cordelia Schmid},
journal= {arXiv preprint arXiv:1510.00857},
year = {2016}
}
备注
IEEE Transactions on Pattern Analysis and Machine Intelligence, in press, 2015