中文

用于相似度度量的姿态选择性最大池化

计算机视觉与模式识别 2017-02-03 v4 人工智能 机器学习 机器学习

摘要

在本文中,我们处理了在实际的基于视频的人脸识别中度量主体身份相似度所面临的两个挑战——非受控环境中头部姿态的变化以及处理视频的计算开销。由于逐帧特征的均值无法表征帧间的姿态多样性,我们定义并保留了视频中的整体姿态多样性与紧致性。这样,由于姿态甚至在单个视频内部也会变化,身份将成为跨视频变化的唯一来源。我们不简单地使用所有帧,而是选择那些姿态点最接近包含该姿态点的 K-means 簇质心的面部。然后,我们将一个视频表示为一个逐帧深度人脸特征的包,而特征数量已从数百个减少到 K 个。由于该视频表示能够很好地表征身份,现在我们将两个视频间的主体相似度度量为这两个特征包中所有可能特征对之间的最大相关性。在用于人脸验证的 YouTube Face 数据集官方 5,000 对视频对上,我们的算法取得了与对所有帧的深度特征取平均的 VGG-face 相当的性能。其他视觉任务也可以受益于利用几何线索来提升深度特征描述能力的通用思想。

关键词

引用

@article{arxiv.1609.07042,
  title  = {Pose-Selective Max Pooling for Measuring Similarity},
  author = {Xiang Xiang and Trac D. Tran},
  journal= {arXiv preprint arXiv:1609.07042},
  year   = {2017}
}

备注

The tutorial and program associated with this paper are available at https://github.com/eglxiang/ytf yet for non-commercial use