中文

LRDif:用于屏下摄像头情绪识别的扩散模型

计算机视觉与模式识别 2024-02-02 v1

摘要

本研究引入了 LRDif,这是一种专门针对屏下摄像头 (UDC) 背景下的面部表情识别 (FER) 设计的新型基于扩散的框架。为了应对 UDC 图像退化带来的固有挑战(如清晰度降低和噪声增加),LRDif 采用了两阶段训练策略,该策略集成了一个紧凑的初步提取网络 (FPEN) 和一个敏捷的 transformer 网络 (UDCformer),以有效地从 UDC 图像中识别情绪标签。通过利用扩散模型 (DMs) 强大的分布映射能力和 transformer 的空间依赖建模强度,LRDif 有效地克服了 UDC 环境中固有的噪声和失真障碍。在包括 RAF-DB、KDEF 和 FERPlus 在内的标准 FER 数据集上进行的综合实验表明,LRDif 展现出了 SOTA 性能,突显了其在推进 FER 应用方面的潜力。这项工作不仅通过解决 FER 中的 UDC 挑战填补了文献中的重大空白,而且为该领域未来的研究设定了新的基准。

关键词

引用

@article{arxiv.2402.00250,
  title  = {LRDif: Diffusion Models for Under-Display Camera Emotion Recognition},
  author = {Zhifeng Wang and Kaihao Zhang and Ramesh Sankaranarayana},
  journal= {arXiv preprint arXiv:2402.00250},
  year   = {2024}
}