ActFER:基于主动工具增强视觉推理的智能体面部表情识别
计算机视觉与模式识别
2026-04-13 v1
摘要
多模态大语言模型(MLLMs)的最新进展为面部表情识别(FER)提供了新的机会,使其从纯标签预测转向基于推理的情感理解。然而,现有的MLLM-based FER方法仍遵循被动范式:它们依赖外部准备的面部输入,并在固定的视觉证据上进行单次推理,缺乏主动面部感知的能力。为解决这一限制,我们提出ActFER——一个通过主动工具增强视觉推理实现智能体面部表情识别的框架。具体而言,ActFER动态调用人脸检测和对齐工具,选择性地放大信息丰富的局部区域,通过视觉链式思考对面部动作单元(AUs)和情绪进行推理。为实现此行为,我们进一步开发了Utility-Calibrated GRPO(UC-GRPO)——一种针对智能体FER的强化学习算法。UC-GRPO采用基于AU的多级可验证奖励来丰富监督信号,采用查询条件对比效用估计以实现局部检查的样本感知动态信用分配,并利用情绪感知的指数移动平均校准以减少噪声效用估计的同时捕捉情绪层面的检查倾向。该算法使ActFER能够学习何时进行局部检查是有益的,以及如何对获取的证据进行推理。全面的实验表明,使用UC-GRPO训练的ActFER持续优于被动MLLM-based FER基线方法,显著提高了AU预测准确率。
引用
@article{arxiv.2604.08990,
title = {ActFER: Agentic Facial Expression Recognition via Active Tool-Augmented Visual Reasoning},
author = {Shifeng Liu and Zhengye Zhang and Sirui Zhao and Xinglong Mao and Zhehan Kan and Zhixiang Wei and Shiwei Wu and Chaoyou Fu and Tong Xu and Enhong Chen},
journal= {arXiv preprint arXiv:2604.08990},
year = {2026}
}
备注
10 pages, 7 figures