中文

面向图像集识别的格拉斯曼流形学习互子空间方法

计算机视觉与模式识别 2021-11-09 v1

摘要

本文解决给定一组图像作为输入(例如多相机源和视频帧)的物体识别问题。基于卷积神经网络(CNN)的框架不能有效利用这些集合,其将模式作为观测值处理,未考虑集合中图像的方差,因而无法捕捉底层特征分布。为解决此问题,我们提出格拉斯曼流形学习互子空间方法(G-LMSM),一种嵌入于 CNN 顶部的神经网络层作为分类器,能更有效地处理图像集并以端到端方式训练。图像集由低维输入子空间表示;该输入子空间通过其规范角的相似性(一种可解释且易于计算的度量)与参考子空间匹配。G-LMSM 的核心思想是将参考子空间学习为格拉斯曼流形上的点,利用黎曼随机梯度下降进行优化。该学习稳定、高效且理论依据充分。我们在手形识别、人脸识别和面部情绪识别上展示了所提方法的有效性。

关键词

引用

@article{arxiv.2111.04352,
  title  = {Grassmannian learning mutual subspace method for image set recognition},
  author = {Lincon S. Souza and Naoya Sogi and Bernardo B. Gatto and Takumi Kobayashi and Kazuhiro Fukui},
  journal= {arXiv preprint arXiv:2111.04352},
  year   = {2021}
}