FaceBench:用于基准测试人脸感知 MLLM 的多视角多层级人脸属性 VQA 数据集
计算机视觉与模式识别
2025-03-28 v1
摘要
多模态大语言模型 (MLLMs) 在各种任务中展现出了卓越的能力。然而,如何有效地在人脸感知上评估这些 MLLMs 仍在很大程度上未被探索。为了填补这一空白,我们引入了 FaceBench,这是一个具有分层多视角和多层级属性的数据集,专门设计用于评估 MLLMs 的全面人脸感知能力。首先,我们构建了一个分层的人脸属性结构,包含五个视角,属性最多达三个层级,总计超过 210 个属性和 700 个属性值。基于该结构,提出的 FaceBench 包含 49,919 个用于评估的视觉问答 (VQA) 对和 23,841 个用于微调的 VQA 对。此外,我们通过使用我们提出的人脸 VQA 数据进行训练,进一步开发了一个稳健的人脸感知 MLLM 基线 Face-LLaVA。我们在各种主流 MLLMs 和 Face-LLaVA 上进行了广泛实验,以测试它们的人脸感知能力,并将结果与人类表现进行了比较。结果表明,现有的 MLLMs 在理解细粒度人脸属性方面远未达到令人满意的程度,而我们的 Face-LLaVA 仅需少量训练数据便显著优于现有开源模型,并与 GPT-4o 和 Gemini 等商业模型相当。该数据集将发布于 https://github.com/CVI-SZU/FaceBench。
引用
@article{arxiv.2503.21457,
title = {FaceBench: A Multi-View Multi-Level Facial Attribute VQA Dataset for Benchmarking Face Perception MLLMs},
author = {Xiaoqin Wang and Xusen Ma and Xianxu Hou and Meidan Ding and Yudong Li and Junliang Chen and Wenting Chen and Xiaoyang Peng and Linlin Shen},
journal= {arXiv preprint arXiv:2503.21457},
year = {2025}
}
备注
Accepted by CVPR2025