中文

面向千亿规模多模态生物识别搜索的挑战

计算机视觉与模式识别 2026-05-11 v1 人工智能

摘要

搜索包含十亿条记录的多生物识别数据库以实现国家级身份识别系统,需要突破生物识别系统所有方面的极限,包括数据采集、预处理、特征提取、准确性、匹配速度、presentation attack检测,以及处理特殊情况(例如缺失手指指纹)。这篇论文首次对这样一个大规模多模态生物识别搜索系统——称为Bharat ABIS的系统进行深度分析,其基于开源架构构建。Bharat ABIS的端到端管道将指纹、面部和虹膜等模态数据经过模态特定的预处理(分割)、质量评估、presentation attack检测和学习嵌入(特征提取)阶段,生成每个人的13.5KB拼接模板。我们对各模态数据及其集成方式进行了详细分析,以创建高效且有效的解针对1:N搜索(去重)的解决方案。在来自印度Aadhaar数据库155亿条记录中随机抽取的2.2亿条身份证明构成的、按人口统计学分布分层的画廊上进行评估,成人探针(18岁以上)的FNIR为0.3%,FPIR为0.5%。我们还将Bharat ABIS与三套最先进的商业-off-the-shelf(COTS)系统在2000万画廊上的性能进行了比较。该系统在单台服务器(8xNVIDIA H100 GPU,2TB RAM)上可处理4000万画廊的每秒100次搜索。

关键词

引用

@article{arxiv.2605.07655,
  title  = {Towards Billion-scale Multi-modal Biometric Search},
  author = {Arka Koner and Chetan S. Naik and Lokesh Kurre and Vivek Raghavan and Barada P. Sabut and Tanusree Deb Barma and Anoop M. Namboodiri and Anil K. Jain},
  journal= {arXiv preprint arXiv:2605.07655},
  year   = {2026}
}