中文

探索视觉语言模型在面部属性识别中的应用:情感、种族、性别与年龄

计算机视觉与模式识别 2024-11-01 v1

摘要

识别种族、性别、年龄和情感等面部属性的技术在监控、广告内容、情感分析以及人口趋势和社会行为研究等领域有广泛应用。基于图像分析人口特征和面部表情分析面临诸多挑战,原因在于人类面部属性的复杂性。传统方法采用卷积神经网络(CNN)和其他多种深度学习技术,在大量标注图像数据集上进行训练。虽然这些方法表现出有效的性能,但仍存在进一步优化的空间。在本文中,我们提出利用视觉语言模型(VLMs),如生成式预训练变换器(GPT)、GEMINI、大型语言与视觉助手(LLAVA)、PaliGemma 和 Microsoft Florence2,从含有人脸的图像中识别种族、性别、年龄和情感等面部属性。使用了 FairFace、AffectNet 和 UTKFace 等多种数据集来评估这些方法。结果表明,视觉语言模型的性能与传统技术相当甚至更优。此外,我们提出了"FaceScanPaliGemma"——一个微调的 PaliGemma 模型——用于种族、性别、年龄组和情感识别。结果分别显示种族、性别、年龄组和情感分类的准确率为 81.1%、95.8%、80% 和 59.4%,优于 PaliGemma 预训练版本、其他视觉语言模型和现有最优方法。最后,我们提出了"FaceScanGPT",这是一个 GPT-4o 模型,用于在图像中存在多个人时识别上述属性,通过针对具有特定面部和/或物理特征的人进行提示工程驱动检测和识别任务。结果凸显了 FaceScanGPT 在仅使用提示驱动检测和识别任务的情况下,检测个体的发型、衣物颜色、姿态等属性的卓越多任务能力。

关键词

引用

@article{arxiv.2410.24148,
  title  = {Exploring Vision Language Models for Facial Attribute Recognition: Emotion, Race, Gender, and Age},
  author = {Nouar AlDahoul and Myles Joshua Toledo Tan and Harishwar Reddy Kasireddy and Yasir Zaki},
  journal= {arXiv preprint arXiv:2410.24148},
  year   = {2024}
}

备注

52 pages, 13 figures