在无监督图像描述生成中去除图像与伪描述间的词级虚假对齐
计算与语言
2021-06-02 v2 计算机视觉与模式识别
摘要
无监督图像描述生成是一项具有挑战性的任务,旨在无需图像-句子对监督的情况下生成描述,仅利用来自不同来源的图像与句子以及从图像中检测出的物体标签。在先前工作中,伪描述(即包含检测出的物体标签的句子)被分配给给定图像。先前工作的重点在于输入图像与伪描述在句子级的对齐。然而,伪描述包含许多与给定图像无关的词。本工作中,我们研究从图像-句子对齐中移除不匹配词的影响,以确定它们如何使该任务变得困难。我们提出一种简单的门控机制,经训练以将图像特征仅与伪描述中最可靠的词(即检测出的物体标签)对齐。实验结果表明,在不引入复杂句子级学习目标的情况下,我们所提方法优于先前方法。与先前工作的句子级对齐方法结合后,我们的方法进一步提升了性能。这些结果证实了词级细节中精细对齐的重要性。
引用
@article{arxiv.2104.13872,
title = {Removing Word-Level Spurious Alignment between Images and Pseudo-Captions in Unsupervised Image Captioning},
author = {Ukyo Honda and Yoshitaka Ushiku and Atsushi Hashimoto and Taro Watanabe and Yuji Matsumoto},
journal= {arXiv preprint arXiv:2104.13872},
year = {2021}
}
备注
EACL 2021 (11 pages, 3 figures; added references)