中文

基于混合高斯-拉普拉斯混合模型的Fisher向量用于图像标注

计算机视觉与模式识别 2015-01-27 v2

摘要

在传统的目标识别流程中,描述符在图像上密集采样,汇集到高维非线性表示,然后传递给分类器。近年来,Fisher向量已被经验证明是多种应用中的领先表示。Fisher向量通常取描述符对数似然相对于高斯混合模型(GMM)参数的梯度。基于不同数据集应使用不同分布的假设,我们提出了另外两种混合模型,并推导了它们的期望最大化算法和Fisher向量表达式。第一种是拉普拉斯混合模型(LMM),基于拉普拉斯分布。第二种是混合高斯-拉普拉斯混合模型(HGLMM),基于高斯分布和拉普拉斯分布的加权几何平均。后者的期望最大化算法的一个有趣性质是,在最大化步骤中,每个分量中的每个维度被选择为高斯或拉普拉斯。最后,通过使用从HGLMM导出的新Fisher向量,我们在图像标注和基于句子的图像搜索任务上取得了最先进的结果。

关键词

引用

@article{arxiv.1411.7399,
  title  = {Fisher Vectors Derived from Hybrid Gaussian-Laplacian Mixture Models for Image Annotation},
  author = {Benjamin Klein and Guy Lev and Gil Sadeh and Lior Wolf},
  journal= {arXiv preprint arXiv:1411.7399},
  year   = {2015}
}

备注

new version includes text synthesis by an RNN and experiments with the COCO benchmark