用于接地图像描述生成的分布式注意力机制
计算机视觉与模式识别
2021-08-24 v2 多媒体
摘要
我们研究了弱监督接地图像描述生成问题。即,给定一张图像,目标是自动生成一个描述图像上下文的句子,其中每个名词词语都接地到图像中对应的区域。由于缺乏明确的细粒度区域-词语对齐作为监督,这项任务颇具挑战性。以往的弱监督方法主要探索各种正则化方案来提高注意力准确性。然而,它们的性能仍远不及全监督方法。一个被忽略的主要问题是,用于生成视觉可接地词语的注意力可能只集中在最具区分性的部分,而无法覆盖整个物体。为此,我们提出了一种简单而有效的方法来缓解这个问题,在本文中我们称之为部分接地问题。具体来说,我们设计了一种分布式注意力机制,强制网络在生成词语时,从多个空间不同但语义一致的区域聚合信息。因此,所关注区域提议的并集应形成一个完全包围感兴趣物体的视觉区域。大量实验证明了我们提出的方法相较于当前最优技术的优越性。
引用
@article{arxiv.2108.01056,
title = {Distributed Attention for Grounded Image Captioning},
author = {Nenglun Chen and Xingjia Pan and Runnan Chen and Lei Yang and Zhiwen Lin and Yuqiang Ren and Haolei Yuan and Xiaowei Guo and Feiyue Huang and Wenping Wang},
journal= {arXiv preprint arXiv:2108.01056},
year = {2021}
}
备注
mm21