AU-LLM:基于增强型 LLM 的微表情动作单元检测
计算机视觉与模式识别
2025-07-30 v1
摘要
微表情动作单元(Action Units, AUs)的检测是情感计算中的一项艰巨任务,对于解码人类细微的、不自主的情绪至关重要。虽然大型语言模型(Large Language Models, LLMs)展示出深刻的推理能力,但其应用于微表情 AU 检测这一细粒度、低强度领域的研究仍鲜有探索。本文首次将 LLM 应用于该方向,提出一种新型框架 AU-LLM,首次利用 LLM 检测微表情数据集中细微强度且数据稀缺的 AUs。我们特别解决视觉-语言语义鸿沟问题,提出增强融合投影器(Enhanced Fusion Projector, EFP)。EFP 采用多层感知器(Multi-Layer Perceptron, MLP)对专用 3D-CNN 主干网络中中级(局部纹理)和高级(全局语义)视觉特征进行智能融合,生成单个信息密集型标记。这一紧凑的表征有效地赋予 LLM 对细微面部肌肉运动进行精细推理。在对基准数据集 CASME II 和 SAMM 进行大规模评估,包括严格的逐主体留存(Leave-One-Subject-Out, LOSO)和跨域协议测试后,AU-LLM 建立了新的状态-of-the-art,验证了 LLM 基于推理在微表情分析中的显著潜力和鲁健性。代码已公开于 https://github.com/ZS-liu-JLU/AU-LLMs。
引用
@article{arxiv.2507.21778,
title = {AU-LLM: Micro-Expression Action Unit Detection via Enhanced LLM-Based Feature Fusion},
author = {Zhishu Liu and Kaishen Yuan and Bo Zhao and Yong Xu and Zitong Yu},
journal= {arXiv preprint arXiv:2507.21778},
year = {2025}
}