中文

鲁棒动态面部表情识别

计算机视觉与模式识别 2025-02-25 v1 人工智能

摘要

动态面部表情识别(DFER)是研究自动识别视频数据中面部表情的新兴领域。虽然现有研究主要聚焦于在噪声和困难样本上学习表征,但样本同时存在噪声和困难类型的问题尚未得到解决。为克服此挑战,本文提出鲁棒方法以区分困难样本与噪声样本。通过评估模型在不同视频剪辑上的预测一致性来实现。随后可采用强化困难样本学习并减轻噪声样本影响的 methodology。此外,为识别视频中的主表达式并提升模型的表征学习能力,本文提出关键表达式重抽框架和双流层次网络,即鲁棒动态面部表情识别(RDFER)。关键表达式重抽框架旨在识别关键表达式,从而缓解非目标表达式可能引起的混淆。RDFER 采用两个序列模型,以 disentangle 短期面部运动和长期情感变化。所提方法经在 DFEW 和 FERV39K 等基准数据集上的大规模实验表明优于当前研究的 State-Of-The-Art 水平。综合分析提供了关于所提一致性的宝贵见解和观察。本工作对动态面部表情识别领域具有重要意义,并推动了该领域基于噪声一致性的鲁棒学习进一步发展。代码已公开于 https://github.com/Cross-Innovation-Lab/RDFER。

关键词

引用

@article{arxiv.2502.16129,
  title  = {Robust Dynamic Facial Expression Recognition},
  author = {Feng Liu and Hanyang Wang and Siyuan Shen},
  journal= {arXiv preprint arXiv:2502.16129},
  year   = {2025}
}