FaceID-6M:一个大规模、开源的 FaceID 定制数据集
计算机视觉与模式识别
2025-03-28 v3 人工智能
摘要
由于当前人脸身份(FaceID)定制方法的数据驱动特性,所有 SOTA 模型都依赖于包含数百万高质量文本-图像对的大规模数据集进行训练。然而,这些数据集均未公开,这限制了透明度并阻碍了该领域的进一步发展。为了解决这个问题,本文收集并发布了 FaceID-6M,这是首个包含 600 万高质量文本-图像对的大规模开源 FaceID 数据集。FaceID-6M 从 LAION-5B \cite{schuhmann2022laion} 中筛选而来,经历了严格的图像和文本过滤步骤以确保数据集质量,包括用于保持高质量图像和人脸的分辨率过滤、用于去除缺乏人脸图像的人脸过滤,以及用于保留包含人类相关术语(例如,国籍、职业和姓名)描述的基于关键词的策略。通过这些清洗过程,FaceID-6M 提供了一个高质量的数据集,专为训练强大的 FaceID 定制模型而优化,通过为研究和开发提供开放资源来促进该领域的进步。我们进行了广泛的实验以展示我们 FaceID-6M 的有效性,证明在 FaceID-6M 数据集上训练的模型取得了与当前可用工业模型相当且略优的性能。此外,为了支持和推进 FaceID 定制社区的研究,我们将代码、数据集和模型完全公开。我们的代码、模型和数据集可在以下地址获取:https://github.com/ShuheSH/FaceID-6M。
引用
@article{arxiv.2503.07091,
title = {FaceID-6M: A Large-Scale, Open-Source FaceID Customization Dataset},
author = {Shuhe Wang and Xiaoya Li and Jiwei Li and Guoyin Wang and Xiaofei Sun and Bob Zhu and Han Qiu and Mo Yu and Shengjie Shen and Tianwei Zhang and Eduard Hovy},
journal= {arXiv preprint arXiv:2503.07091},
year = {2025}
}
备注
arXiv admin note: text overlap with arXiv:2501.15407