CLIP 与十亿图像数据集时代的面部识别
计算机视觉与模式识别
2023-01-19 v1
摘要
OpenAI 开发的 CLIP(对比语言-图像预训练)模型在各种图像识别与检索任务上取得了出色结果,展现出强大的零样本性能。这意味着它们能够有效执行未经显式训练的任务。受 OpenAI CLIP 成功的启发,收集了一个名为 LAION-5B 的新公开可用数据集,由此开发了超越 OpenAI L/14 模型的开放 ViT-H/14、ViT-G/14 模型。LAION-5B 数据集还发布了近似最近邻索引,带有用于搜索与子集创建的 Web 接口。本文中,我们评估了各类 CLIP 模型作为零样本面部识别器的性能。我们的结果表明,CLIP 模型在面部识别任务上表现良好,但增大 CLIP 模型规模未必带来精度提升。此外,我们通过测试 CLIP 模型在投毒数据上的性能,考察其对数据投毒攻击的鲁棒性。通过该分析,我们旨在理解使用 CLIP 模型构建的搜索引擎的潜在后果与滥用可能,这类引擎或可作为无意识面部识别引擎运行。
引用
@article{arxiv.2301.07315,
title = {Face Recognition in the age of CLIP & Billion image datasets},
author = {Aaditya Bhat and Shrey Jain},
journal= {arXiv preprint arXiv:2301.07315},
year = {2023}
}