Face-MLLM:大型人脸感知模型
计算机视觉与模式识别
2024-10-29 v1
摘要
尽管多模态大语言模型(MLLM)在广泛的视觉-语言任务上取得了可喜的成果,但其感知和理解人脸的能力却很少被探索。在这项工作中,我们全面评估了现有 MLLM 在人脸感知任务上的表现。定量结果表明,现有 MLLM 难以处理这些任务。其主要原因是缺乏包含人脸细粒度描述的图像-文本数据集。为了解决这个问题,我们设计了一个实用的数据集构建流程,并在此基础上进一步构建了一个新颖的多模态大型人脸感知模型,即 Face-MLLM。具体而言,我们用更详细的人脸描述和面部属性标签重新标注了 LAION-Face 数据集。此外,我们使用问答风格重新构建了传统人脸数据集,以适配 MLLM。结合这些丰富的数据集,我们开发了一种新颖的三阶段 MLLM 训练方法。在前两个阶段,我们的模型分别学习视觉-文本对齐和基本的视觉问答能力。在第三阶段,我们的模型学习处理多个专门的人脸感知任务。实验结果表明,我们的模型在五个著名的人脸感知任务上超越了先前的 MLLM。此外,在我们新引入的零样本面部属性分析任务上,Face-MLLM 也展现出优越的性能。
引用
@article{arxiv.2410.20717,
title = {Face-MLLM: A Large Face Perception Model},
author = {Haomiao Sun and Mingjie He and Tianheng Lian and Hu Han and Shiguang Shan},
journal= {arXiv preprint arXiv:2410.20717},
year = {2024}
}