利用扩散模型生成的合成数据改进面部表情识别
计算机视觉与模式识别
2024-11-19 v1 人机交互
图像与视频处理
摘要
面部表情识别(FER)在计算机视觉中发挥着至关重要的作用,在人机交互、情感计算以及心理健康监测和个性化学习环境等领域具有重要应用。然而,FER 任务面临的一个主要挑战是现有数据集中普遍存在的类别不平衡问题,这会阻碍模型的性能和泛化能力。在本文中,我们通过引入合成数据增强并利用 ResEmoteNet 模型来解决数据不平衡问题,以提升面部表情识别任务的整体性能。我们采用 Stable Diffusion 2 和 Stable Diffusion 3 Medium 模型生成合成的面部表情数据,对 FER2013 和 RAF-DB 基准数据集的训练集进行增强。使用这些增强数据集训练 ResEmoteNet 取得了显著的性能提升,在 FER2013 上达到了 96.47% 的准确率,在 RAF-DB 上达到了 99.23% 的准确率。这些结果表明在 FER2013 上实现了 16.68% 的绝对提升,在 RAF-DB 上实现了 4.47% 的绝对提升,并突出了合成数据增强在增强 FER 模型方面的有效性,强调了先进生成模型在 FER 研究和应用中的潜力。ResEmoteNet 的源代码可在 https://github.com/ArnabKumarRoy02/ResEmoteNet 获取。
引用
@article{arxiv.2411.10863,
title = {Improvement in Facial Emotion Recognition using Synthetic Data Generated by Diffusion Model},
author = {Arnab Kumar Roy and Hemant Kumar Kathania and Adhitiya Sharma},
journal= {arXiv preprint arXiv:2411.10863},
year = {2024}
}
备注
5 pages, 4 tables, 4 figures, ICASSP 2025