中文

将图像描述生成与基于规则的实体掩码相集成

计算机视觉与模式识别 2020-07-24 v1 计算与语言 机器学习

摘要

给定一幅图像,生成其自然语言描述(即标题)是一个被广泛研究的问题。为解决该问题所提出的方法通常依赖于难以解释的图像特征。具体而言,这些图像特征被细分为全局与局部特征,其中全局特征从图像的全局表示中提取,而局部特征从图像中局部检测到的物体提取。尽管局部特征提取了丰富的视觉信息,现有模型以黑盒方式生成标题,人类难以解释标题旨在表示哪些局部物体。因此,本文提出一种新颖的图像描述生成框架,具有显式物体(如知识图谱实体)选择过程,同时仍保持其端到端训练能力。该模型首先根据人类可解释的掩码显式选择哪些局部实体纳入标题,然后通过关注所选实体生成恰当标题。在 MSCOCO 数据集上的实验表明,与先前同类方法相比,我们的方法在标题质量与多样性方面取得良好性能,且生成过程更具可解释性。

关键词

引用

@article{arxiv.2007.11690,
  title  = {Integrating Image Captioning with Rule-based Entity Masking},
  author = {Aditya Mogadala and Xiaoyu Shen and Dietrich Klakow},
  journal= {arXiv preprint arXiv:2007.11690},
  year   = {2020}
}