中文

TAG:面向面部表情识别的行动单元 grounding 思考方法

计算机视觉与模式识别 2026-02-24 v1 人工智能

摘要

面部表情识别(FER)是一种细粒度视觉理解任务,需对局部且有意义的面部线索进行推理才能获得可靠预测。最近的视觉--语言模型(VLM)为 FER 启用了自然语言解释,但其推理往往缺乏依托,导致生成的理由虽流畅却难以核查,与视觉证据的关联性弱且易产生幻觉,从而在不同数据集之间表现出较差的鲁棒性。我们提出了 TAG(Thinking with Action Unit Grounding),一种基于行动单元(AU)的视觉--语言框架,显式约束多模态推理必须以面部 AU 为依托。TAG要求中间推理步骤依托于与 AU 相关的面部区域,从而获得伴随可核查视觉证据的预测。模型通过在 AU 依托推理痕迹上进行监督微调,随后利用 AU 感知奖励进行强化学习,以对齐预测区域与外部 AU 检测器。经测试在 RAF-DB、FERPlus 和 AffectNet 上的表现均优于强大的开源和闭源 VLM 基线,同时提升了视觉忠实度。消融实验和偏好研究进一步表明,AU 依托奖励可稳定推理过程并缓解幻觉,证明了结构化依托中间表征对 FER 场景下可信多模态推理的重要性。代码将发布于 https://github.com/would1920/FER_TAG。

关键词

引用

@article{arxiv.2602.18763,
  title  = {TAG: Thinking with Action Unit Grounding for Facial Expression Recognition},
  author = {Haobo Lin and Tianyi Bai and Jiajun Zhang and Xuanhao Chang and Sheng Lu and Fangming Gu and Zengjie Hu and Wentao Zhang},
  journal= {arXiv preprint arXiv:2602.18763},
  year   = {2026}
}

备注

33 pages, 8 figures