论图像表示的内蕴维数
计算机视觉与模式识别
2019-04-12 v2 机器学习
摘要
本文探讨了与任何给定图像表示的内蕴维数相关的以下问题:估计其内蕴维数;开发一种基于深度神经网络的非线性映射(称为 DeepMDS),将环境表示转换为最小内蕴空间;以及通过在内蕴空间中进行图像匹配来验证该映射的准确性。在基准图像数据集(LFW、IJB-C 和 ImageNet-100)上的实验表明,深度神经网络表示的内蕴维数显著低于环境特征的维数。例如,SphereFace 的 512 维人脸表示和 ResNet 的 512 维图像表示的内蕴维数分别为 16 和 19。此外,DeepMDS 映射能够在很大程度上保持判别能力的同时,获得维数显著降低的表示:在 IJB-C 上,16 维时的 TAR 为 59.75%(@ 0.1% FAR),而 512 维时的 TAR 为 71.26%;在 ImageNet-100 上,19 维时的 Top-1 准确率为 77.0%,而 512 维时为 83.4%。
引用
@article{arxiv.1803.09672,
title = {On the Intrinsic Dimensionality of Image Representations},
author = {Sixue Gong and Vishnu Naresh Boddeti and Anil K. Jain},
journal= {arXiv preprint arXiv:1803.09672},
year = {2019}
}
备注
Accepted for publication at CVPR 2019