中文

论人脸表示的容量

计算机视觉与模式识别 2019-04-15 v3 机器学习

摘要

在本文中,我们探讨以下问题:给定一个人脸表示,它能分辨多少个身份?换句话说,人脸表示的容量是多少?估计给定人脸表示容量的科学基础不仅将有助于评估和比较不同的表示方法,还将确立自动人脸识别系统可扩展性的上限。我们将人脸容量问题转化为深度表示空间中嵌入的低维流形上的填充边界问题。通过显式地考虑表示的流形结构以及两种不同来源的表示噪声:认知(模型)不确定性和偶然(数据)变异性,我们的方法能够估计给定人脸表示的容量。为了证明我们方法的有效性,我们估计了两种基于深度神经网络的人脸表示的容量,即 128 维的 FaceNet 和 512 维的 SphereFace。在无约束人脸 (IJB-C) 上的数值实验表明,在 1% 的误识率 (FAR) 下,FaceNet 的容量上限为 2.7×1042.7\times10^4,SphereFace 表示的容量上限为 8.4×1048.4\times10^4。正如预期的那样,在更低的 FAR 下容量急剧下降。在 FAR 为 0.1% 和 0.001% 时,FaceNet 的容量分别为 2.2×1032.2\times10^31.6×1011.6\times10^{1},SphereFace 的容量分别为 3.6×1033.6\times10^36.0×1006.0\times10^0

关键词

引用

@article{arxiv.1709.10433,
  title  = {On the Capacity of Face Representation},
  author = {Sixue Gong and Vishnu Naresh Boddeti and Anil K. Jain},
  journal= {arXiv preprint arXiv:1709.10433},
  year   = {2019}
}