中文

基于微动作的情感识别的混合监督范数化增强Transformer

计算机视觉与模式识别 2026-01-21 v1

摘要

微动作是无意识完成的身体动作,可传递人类情感状态,正逐渐受到人类行为理解和情感计算等领域的关注作为一个新兴主题。然而,基于微动作建模人类情感的研究尚不充分。本文提出通过在混合监督框架下利用螺旋范数化增强Transformer重构行为模式来识别情感状态。在该框架中,分别通过堆叠螺旋范数化自注意力和多尺度时序卷积模块设计了基于螺旋范数化Transformer的编码器和解码器。尤其,为更好捕捉微动作的细微运动,我们构建了一个额外的上采样解码器,用于以自监督方式进行重构任务。我们进一步提出的螺旋范数化自注意力模块,其中在解缠(hyperedges)之间逐步更新骨骼关节,以呈现身体关节之间的关系,用于建模细微局部运动。最后,为利用情感状态与微动作局部运动之间的关系,设计了一个从编码器输出中提取的情感识别头部,采用浅层结构进行监督学习。该端到端框架通过综合利用自重构和监督信息,以单阶段方式进行联合训练。我们的方法在两个公开数据集(iMiGUE和SMG)上进行评估,在多个指标下均实现最佳性能,优于现有方法。

关键词

引用

@article{arxiv.2507.14867,
  title  = {Hybrid-supervised Hypergraph-enhanced Transformer for Micro-gesture Based Emotion Recognition},
  author = {Zhaoqiang Xia and Hexiang Huang and Haoyu Chen and Xiaoyi Feng and Guoying Zhao},
  journal= {arXiv preprint arXiv:2507.14867},
  year   = {2026}
}