Facial-R1:面部情感分析中的推理与识别对齐
计算机视觉与模式识别
2025-11-14 v1
摘要
面部情感分析(Facial Emotion Analysis, FEA)扩展了传统的面部情感识别,纳入了可解释的细粒度推理。该任务集成了三个子任务:情感识别、面部动作单元(Action Unit, AU)识别以及基于AU的情感推理,以联合建模情感状态。虽然最近的方法利用视觉语言模型(Vision-Language Models, VLMs)并取得了有希望的成果,但它们面临两个关键限制:(1)幻觉推理,即VLMS生成的合乎情节但不准确的解释由于情感特定知识不足而导致;(2)情感推理与识别之间的对齐,由于观察到的面部特征与最终标签之间的碎片化连接而导致。我们提出了Facial-R1,一个三阶段对齐框架,有效地以最小的监督解决上述两个挑战。首先,我们采用指令微调来建立基本的情感推理能力。其次,我们引入以情感和AU标签作为奖励信号的强化学习训练,显式地将生成的推理过程与预测的情感对齐。最后,我们设计了一个数据合成管道,迭代地利用前述阶段扩展训练数据集,实现可扩展的自我改进。建立在该框架之上,我们引入FEA-20K,一个包含17,737个训练样本和1,688个测试样本的基准数据集,具有细粒度情感分析注释。跨八个标准基准的广泛实验表明,Facial-R1在FEA中实现了状态-of-the-art性能,具有强大的泛化能力和稳健的可解释性。
引用
@article{arxiv.2511.10254,
title = {Facial-R1: Aligning Reasoning and Recognition for Facial Emotion Analysis},
author = {Jiulong Wu and Yucheng Shen and Lingyong Yan and Haixin Sun and Deguo Xia and Jizhou Huang and Min Cao},
journal= {arXiv preprint arXiv:2511.10254},
year = {2025}
}
备注
This paper has been accepted by AAAI 2026. 16 pages, 3 figures, 10 tables