中文

Face-LLaVA:通过指令调谐进行面部表情和属性理解

计算机视觉与模式识别 2025-04-11 v1 人工智能 人机交互

摘要

人脸在社交沟通中占据中心位置, necessitating 使用高性能计算机视觉工具用于以人为中心的应用。我们提出了 Face-LLaVA,一种用于面部中心化、情境学习的多模态大语言模型,包括面部表情和属性识别。此外,Face-LLaVA 能够生成可用于推理的自然语言描述。利用现有的视觉数据库,我们首先开发了 FaceInstruct-1M,一个用于面部处理的指令调谋 MLLM 的面部数据库。我们然后开发了一种新颖的面部特定视觉编码器,由 Face-Region Guided Cross-Attention 集成面部几何与局部视觉特征。我们在九个不同数据集和五个不同面部处理任务上对所提出的方法进行了评估,包括面部表情识别、动作单元检测、面部属性检测、年龄估计和深度伪造检测。Face-LLaVA 在与现有开源 MLLM 比较时取得优异成绩,并在与商业解决方案比较时表现出竞争力。我们的模型输出还在所有任务上以零样本设置下获得更高的推理评级。我们的数据集和模型将在 https://face-llava.github.io 上发布,以支持社交 AI 和基础视觉语言研究的未来进展。

关键词

引用

@article{arxiv.2504.07198,
  title  = {Face-LLaVA: Facial Expression and Attribute Understanding through Instruction Tuning},
  author = {Ashutosh Chaubey and Xulang Guan and Mohammad Soleymani},
  journal= {arXiv preprint arXiv:2504.07198},
  year   = {2025}
}

备注

Project Page: https://face-llava.github.io