面向集合检索的紧凑深度聚合方法
计算机视觉与模式识别
2020-03-27 v1
摘要
本工作的目标是学习一组描述子的紧凑嵌入,使其适于高效检索与排序,同时保持各个描述子的可判别性。我们关注这一一般问题的一个具体实例——从大规模图像数据集中检索包含多张人脸的图像。此处集合由每幅图像中的人脸描述子构成,给定针对多个身份的查询,目标便是按顺序检索出包含所有身份、缺一个身份等的图像。为此,我们做出如下贡献:首先,我们提出一种 CNN 架构——{\em SetNet}——以实现该目标:它学习人脸描述子及其在集合上的聚合,产生专为集合检索设计的紧凑定长描述子,且图像得分是匹配查询的身份数量;其次,我们表明该紧凑描述子在每幅图像至多两张人脸时具有最小的可判别性损失,此后缓慢退化——远优于若干基线方法;第三,我们探讨了使用该紧凑描述子进行集合检索时速度与分析质量的权衡;最后,我们收集并标注了一个包含不同数量名人的大规模图像数据集,用于评估并已公开发布。
引用
@article{arxiv.2003.11794,
title = {Compact Deep Aggregation for Set Retrieval},
author = {Yujie Zhong and Relja Arandjelović and Andrew Zisserman},
journal= {arXiv preprint arXiv:2003.11794},
year = {2020}
}
备注
20 pages