中文

1500万级多模态人脸图像-文本数据集

计算机视觉与模式识别 2024-07-15 v2 人工智能

摘要

当前,基于图像-文本的多模态深度学习模型在诸多领域展现出巨大的潜力。而以人脸图像为中心的任务在实际应用中具有广阔的前景。本文提出了 **FaceCaption-15M**,一个大规模、多样且高质量的人脸图像及其自然语言描述(人脸图像到文本)数据集,以促进以人脸为中心的任务研究。FaceCaption-15M 包含超过1500万对人脸图像及其对应的自然语言描述,目前尚无规模更大的人脸图像-文本数据集。我们对数据集的图像质量、文本自然性、文本复杂度及文本-图像相关性进行了全面分析,以证明 FaceCaption-15M 的优势。为验证 FaceCaption-15M 的有效性,我们首先训练了一个人脸语言-图像预训练模型(FLIP,类似于 CLIP),以在特征空间中对齐人脸图像与其对应描述。随后,我们使用图像编码器和文本编码器,仅微调线性层,基于 FLIP 的模型在两个具有挑战性的人脸任务上取得了最先进的性能。旨在通过 FaceCaption-15M 数据集的公开,推动人脸相关任务领域的研究进展。所有数据、代码和模型均公开可用。https://huggingface.co/datasets/OpenFace-CQUPT/FaceCaption-15M

关键词

引用

@article{arxiv.2407.08515,
  title  = {15M Multimodal Facial Image-Text Dataset},
  author = {Dawei Dai and YuTang Li and YingGe Liu and Mingming Jia and Zhang YuanHui and Guoyin Wang},
  journal= {arXiv preprint arXiv:2407.08515},
  year   = {2024}
}

备注

15 pages, 8 figures