中文

基于自适应边际差异训练的 Emotion Diffusion Classifier 用于面部表情识别

计算机视觉与模式识别 2026-04-01 v1

摘要

面部表情识别(FER)对于人机交互至关重要,因为它使机器能够从面部情感行为中解读人类情绪和内部状态。尽管深度学习显著提升了 FER 的性能,但大多数现有的基于深度学习的 FER 方法严重依赖判别式分类器进行快速预测。这些模型倾向于学习捷径,并且对即使微小的分布偏移也较为脆弱。为解决这一问题,我们采用条件生成扩散模型,并提出了用于 FER 的 Emotion Diffusion Classifier(EmoDC),展示了增强的对抗鲁棒性。然而,使用标准策略重新训练 EmoDC 无法惩罚错误的类别描述,导致识别性能不佳。为改进 EmoDC,我们提出基于边际的差异训练,该方法在正确类别描述的条件下鼓励准确预测,并对不匹配条件下的预测进行惩罚。该方法在正确与错误类别的噪声预测误差之间强制施加最小边际,从而增强模型的判别能力。然而,使用固定边际无法考虑不同图像之间噪声预测的差异性,限制了其有效性。为克服这一限制,我们提出自适应边际差异训练(AMDiT),它为每个样本动态调整边际。大量实验表明,AMDiT 在 100 步评估中显著提升了 EmoDC 在 RAF-DB 基本子集、RAF-DB 复合子集、SFEW-2.0 和 AffectNet 上的准确率。此外,EmoDC 在对噪声和模糊的对抗鲁棒性方面优于最先进的判别式分类器。

关键词

引用

@article{arxiv.2603.29578,
  title  = {Emotion Diffusion Classifier with Adaptive Margin Discrepancy Training for Facial Expression Recognition},
  author = {Rongkang Dong and Cuixin Yang and Cong Zhang and Yushen Zuo and Kin-Man Lam},
  journal= {arXiv preprint arXiv:2603.29578},
  year   = {2026}
}