中文

越南语中的面部表情识别与图像描述生成

计算机视觉与模式识别 2022-08-15 v1

摘要

本文讨论一种面部表情识别模型与一种描述生成模型,用于为图像及图像中人物的面部表情构建描述性句子。我们的研究表明,在 KDEF 数据集上,对于所有情绪,YOLOv5 均比传统 CNN 取得更好的结果。具体而言,CNN 与 YOLOv5 模型在情绪识别上的准确率分别为 0.853 与 0.938。提出了一种基于融合架构的图像描述生成模型,使用 VGG16 并将描述经 LSTM 模型编码。YOLOv5 还用于识别图像中物体的主导颜色,并在必要时修正生成描述中的颜色词。若描述包含指代人物的词,我们识别图像中人物的情绪。最后,我们综合所有模型的结果来创建描述图像视觉内容与人类情绪的句子。在越南语 Flickr8k 数据集上的实验分别取得 BLEU-1、BLEU-2、BLEU-3、BLEU-4 分数 0.628、0.425、0.280 与 0.174。

关键词

引用

@article{arxiv.2208.06117,
  title  = {Facial Expression Recognition and Image Description Generation in Vietnamese},
  author = {Khang Nhut Lam and Kim-Ngoc Thi Nguyen and Loc Huu Nguy and Jugal Kalita},
  journal= {arXiv preprint arXiv:2208.06117},
  year   = {2022}
}

备注

7 pages