中文

Face-Human-Bench:面向多模态助理的面部与人类理解综合基准

计算机视觉与模式识别 2025-10-24 v3 人工智能 计算与语言

摘要

面部和人类是社交交互中至关重要的元素,广泛出现在日常照片和视频中。因此,深入理解面部和人类将使多模态助理在回复质量和应用范围方面获得提升。目前,多模态助理社区缺乏对面部和人类理解能力的全面且科学的评估。本文首先提出了包含三个层次的能力等级体系。基于该等级体系,我们从面部和人类社区的公开数据集中收集图像和标注,构建半自动数据管道以生成新的基准问题。最终获得的Face-Human-Bench包括开发集和测试集,各包含1800个问题,支持英文和中文。我们对25个主流多模态大语言模型(MLLMs)进行评估,关注能力之间的相关性、目标位置对性能的影响以及链路思考(Chain of Thought, CoT)提示对性能的影响。我们还探讨了哪些MLLM能力需要通过专家模型来补充。该数据集和评估代码已公开发布于https://face-human-bench.github.io。

关键词

引用

@article{arxiv.2501.01243,
  title  = {Face-Human-Bench: A Comprehensive Benchmark of Face and Human Understanding for Multi-modal Assistants},
  author = {Lixiong Qin and Shilong Ou and Miaoxuan Zhang and Jiangning Wei and Yuhang Zhang and Xiaoshuai Song and Yuchen Liu and Mei Wang and Weiran Xu},
  journal= {arXiv preprint arXiv:2501.01243},
  year   = {2025}
}

备注

50 pages, 14 figures, 42 tables. NeurIPS 2025 Datasets and Benchmarks Track