MELLM:面向微表情理解的流动引导大语言模型
计算机视觉与模式识别
2025-12-10 v3
摘要
微表情(微表情)是揭示隐藏情绪的短暂且低强度的面部动作,在情感计算中至为重要。尽管微表情识别已取得显著进展,但现有方法主要局限于离散情绪分类,缺乏对微表情综合理解(MEU)的能力,尤其在解释细微面部动态和潜在情绪线索方面。虽然多模态大语言模型(MLLM)在MEU方面凭借其先进推理能力展现了潜力,但仍难以感知如此细微的面部情感行为。为弥合这一差距,我们提出了面向微表情的大语言模型(MELLM),其集成了基于光流的灵敏度,以捕捉细微面部动作,同时保留LLM的强大推理能力。具体而言,引入一种迭代的、基于光流估计算法,命名为MEFlowNet,以精确捕捉面部微动作。为其训练与评估,我们构建了MEFlowDataset——一个包含54,611对发生-顶点图像对的大规模光流数据集,涵盖多样化身份和细微面部动作。随后,我们设计了基于流动引导的微表情理解范式。在此框架下,由MEFlowNet提取的光流信号被用于构建MEU-Instruct——一个针对微表情理解的指令调优数据集。MELLM随后在MEU-Instruct上进行微调,使其能够将细微运动模式转化为人类可读的描述,并生成相应的情绪推断。实验表明,MEFlowNet在面部和微表情光流估计方面显著优于现有光流方法,而MELLM在多个微表情基准测试中实现了最高的准确率和更好的泛化能力。据我们所知,本工作作出了两大关键贡献:首个专为微表情光流估计的MEFlowNet,以及首个面向微表情理解的LLM——MELLM。
引用
@article{arxiv.2505.07007,
title = {MELLM: A Flow-Guided Large Language Model for Micro-Expression Understanding},
author = {Sirui Zhao and Zhengye Zhang and Shifeng Liu and Xinglong Mao and Shukang Yin and Chaoyou Fu and Tong Xu and Enhong Chen},
journal= {arXiv preprint arXiv:2505.07007},
year = {2025}
}