中文

MMA-MRNNet:利用多情感模型与动态掩码RNN实现精准面部表情强度估计

计算机视觉与模式识别 2024-09-05 v4 机器学习

摘要

本文提出MMA-MRNNet,一种用于从视频数据中进行动态多输出面部表情强度估计(FEIE)的新型深度学习架构。该任务的传统方法常依赖复杂的3-D CNN,需要大量预训练并假设面部表情在视频所有帧中均匀分布。这些方法难以处理不同长度的视频,常采用丢弃有价值信息或引入偏差的临时策略。MMA-MRNNet通过两阶段过程应对这些挑战。首先,多情感模型(MMA)提取器组件是一个多任务学习CNN,可同时估计每帧的效价-唤醒度、识别基本面部表情并检测动作单元。这些表征随后由掩码RNN组件处理,该组件捕捉时间依赖关系并根据输入视频的真实长度动态更新权重,确保仅使用最相关的特征进行最终预测。所提出的单模态非集成学习MMA-MRNNet在Hume-Reaction数据集上进行了评估,表现出显著优越的性能,大幅超越最先进方法,无论其为单模态、多模态或集成方法。最后,我们在多个真实场景数据集上展示了所提方法的MMA组件的有效性,其在各项指标上持续优于所有最先进方法。

关键词

引用

@article{arxiv.2303.00180,
  title  = {MMA-MRNNet: Harnessing Multiple Models of Affect and Dynamic Masked RNN for Precise Facial Expression Intensity Estimation},
  author = {Dimitrios Kollias and Andreas Psaroudakis and Anastasios Arsenos and Paraskevi Theofilou and Chunchang Shao and Guanyu Hu and Ioannis Patras},
  journal= {arXiv preprint arXiv:2303.00180},
  year   = {2024}
}