DEFT-LLM:用于微表情识别的解�od 专家特征调校
计算机视觉与模式识别
2025-11-17 v1 人机交互
摘要
微表情识别(MER)对于推断真实情绪至关重要。将多模态大语言模型(MLLM)应用于此任务可对面部运动进行时空分析,并提供可解释的描述。然而,仍存在两个核心挑战:(1)静态外观与动态运动线索的缠绕阻止模型专注于细微运动;(2)现有MER数据集中的文本标签未完全对应于面部肌肉运动,导致文本监督与物理运动之间存在语义鸿沟。为解决这些问题,我们提出了DEFT-LLM,通过多专家解�od实现运动语义对齐。我们首先引入Uni-MER,这是一个面向运动驱动的指令数据集,旨在对齐文本与局部面部运动。其构建利用光流和动作单元(AU)标签的双重约束,确保时空一致性和对运动的合理对应。随后,我们设计了一个包含三个专家的体系结构,将面部动态分解为独立且可解释的表征(结构、动态纹理和运动语义)。通过将Uni-MER中与指令对齐的知识整合到DEFT-LLM中,我们的方法为微表情注入了有效的物理先验,同时利用大语言模型的跨模态推理能力,从而实现对细微情绪线索的精确捕获。在多个具有挑战性的MER基准测试上进行的实验表明,我们的方法实现了最先进的性能,并在可解释建模局部面部运动方面显示出特别优势。
引用
@article{arxiv.2511.10948,
title = {DEFT-LLM: Disentangled Expert Feature Tuning for Micro-Expression Recognition},
author = {Ren Zhang and Huilai Li and Chao qi and Guoliang Xu and Tianyu Zhou and Wei wei and Jianqin Yin},
journal= {arXiv preprint arXiv:2511.10948},
year = {2025}
}