利用面部表情与注意力机制的图像描述生成
计算机视觉与模式识别
2020-04-16 v3 计算与语言
摘要
受益于机器视觉与自然语言处理技术的进步,当前的图像描述(image captioning)系统已能生成详细的视觉描述。在很大程度上,这些描述是对图像的客观刻画,尽管部分模型确实融入了与观察者视角相关的主观方面(如情感);然而,当前模型在描述生成过程中通常不考虑图像的情感内容。本文通过提出使用面部表情特征生成图像描述的新颖模型来解决此问题。这些模型利用长短期记忆(LSTM)网络,在不同时间步将面部特征与其他视觉特征一同应用以生成图像描述。我们使用所有标准评价指标,全面比较了含面部特征与不含面部特征的图像描述模型。评价指标表明,在从标准 Flickr 30K 数据集提取的、包含约 11K 张人脸的图像描述数据集上,将面部特征与注意力机制结合取得了最佳性能,生成了更具表现力且更相关的图像描述。对生成描述的分析发现,或许出人意料,描述质量的提升似乎并非来自添加与图像情感方面相关的形容词,而是来自描述中所涉动作更为丰富多样。
引用
@article{arxiv.1908.02923,
title = {Image Captioning using Facial Expression and Attention},
author = {Omid Mohamad Nezami and Mark Dras and Stephen Wan and Cecile Paris},
journal= {arXiv preprint arXiv:1908.02923},
year = {2020}
}