中文

多模态大语言模型时代的人脸表情识别:基准、数据集与新视角

计算机视觉与模式识别 2025-11-04 v1

摘要

多模态大语言模型 (MLLMs) 在计算机视觉和情感计算等诸多研究领域取得了显著进展。作为这一跨学科领域的关键挑战,人脸表情识别 (FER) 已从独立的、特定于领域的模型演变为更统一的 methods。一个可行的统一 FER 任务的途径是将常规 FER 数据集转换为视觉问答 (VQA) 格式,从而实现对强大通用 MLLM 进行推理的直接应用。然而,尽管最新的 MLLM 在各种任务中取得了成功,但其在 FER 任务上的性能仍鲜有探讨。为弥补这一差距,我们提供 FERBench,一个系统性基准,涵盖 20 个最先进的 MLLM 和四个广泛使用的 FER 数据集。我们的结果表明,尽管 MLLM 在分类任务中表现良好,但在推理和可解释性方面仍面临显著局限。为此,我们引入后训练策略,以增强 MLLM 的人脸表情推理能力。具体而言,我们策划了两个高质量且大规模的数据集:UniFER-CoT-230K 用于 cold-start 初始化,以及 UniFER-RLVR-360K 用于强化学习可验证奖励 (RLVR)。基于此,我们开发了一个统一且可解释的 FER 基础模型,称为 UniFER-7B,超越了许多开源和闭源的通用 MLLM(例如 Gemini-2.5-Pro 和 Qwen2.5-VL-72B)。

关键词

引用

@article{arxiv.2511.00389,
  title  = {Rethinking Facial Expression Recognition in the Era of Multimodal Large Language Models: Benchmark, Datasets, and Beyond},
  author = {Fan Zhang and Haoxuan Li and Shengju Qian and Xin Wang and Zheng Lian and Hao Wu and Zhihong Zhu and Yuan Gao and Qiankun Li and Yefeng Zheng and Zhouchen Lin and Pheng-Ann Heng},
  journal= {arXiv preprint arXiv:2511.00389},
  year   = {2025}
}