中文

Face2Text重访:改进的数据集与基线结果

计算机视觉与模式识别 2022-05-26 v1 神经与进化计算

摘要

当前的图像描述生成模型在描述人脸任务上迁移效果不佳。为鼓励开发更聚焦人的描述,我们基于CelebA图像数据集构建了一个新的面部描述数据集。我们描述了该数据集的属性,并给出了在其上训练的面部描述生成器的结果,探索了从VGGFace/ResNet CNNs进行迁移学习的可行性。通过自动化指标及76名英语参与者的主观评价进行了比较。根据人类评价,VGGFace-LSTM + Attention模型生成的描述最接近真实描述,而ResNet-LSTM + Attention模型取得了最高的CIDEr和CIDEr-D结果(分别为1.252和0.686)。总之,新数据集与这些实验结果为该领域未来工作提供了数据与基线。

关键词

引用

@article{arxiv.2205.12342,
  title  = {Face2Text revisited: Improved data set and baseline results},
  author = {Marc Tanti and Shaun Abdilla and Adrian Muscat and Claudia Borg and Reuben A. Farrugia and Albert Gatt},
  journal= {arXiv preprint arXiv:2205.12342},
  year   = {2022}
}

备注

7 pages, 5 figures, 4 tables, to appear in LREC 2022 (P-VLAM workshop)