基于弱监督注意力惩罚的图像描述生成
计算机视觉与模式识别
2019-03-07 v1
摘要
故事对于家谱研究至关重要,因为它们有助于与人物建立情感联系。许多家族故事保存在历史照片和相册中。近期图像描述生成模型的发展使得自动为照片“讲述故事”成为可能。注意力机制已被广泛采用在许多最先进的基于编码器-解码器的图像描述模型中,因为它可以弥合视觉部分与语言部分之间的差距。大多数现有的描述模型使用词似然损失隐式训练注意力模块。同时,大量研究使用基于梯度的方法探究了视觉模型的内在注意力。理想情况下,对于任意给定的视觉概念,描述模型预测的注意力图应与视觉模型的内在注意力一致。然而,目前尚无工作将隐式学习的注意力图与视觉内在注意力对齐。本文中,我们提出了一种新颖的模型,用于度量描述预测的注意力与视觉内在注意力之间的一致性。该对齐损失允许在不使用任何昂贵的边界框标注的情况下进行显式注意力校正。我们在 COCO 数据集以及来自 Ancestry.com Operations Inc. 的家谱数据集(包含数十亿张历史照片)上开发并评估了我们的模型。所提模型在两个数据集的所有常用语言评估指标上均取得了更好的性能。
引用
@article{arxiv.1903.02507,
title = {Image captioning with weakly-supervised attention penalty},
author = {Jiayun Li and Mohammad K. Ebrahimpour and Azadeh Moghtaderi and Yen-Yun Yu},
journal= {arXiv preprint arXiv:1903.02507},
year = {2019}
}
备注
10 pages, 5 figures