中文

基于全局-局部判别目标的细粒度图像描述生成

计算机视觉与模式识别 2020-07-22 v1 多媒体

摘要

近年来,图像描述生成作为视觉与语言领域的活跃课题取得了显著进展。然而,现有方法往往生成过于笼统的描述,且包含一些最常见词汇/短语,导致描述不准确且难以区分(见图1)。这主要源于:(i) 传统训练目标的保守特性,驱使模型为相似图像生成正确但几乎无判别力的描述;(ii) 真实描述中词分布的不均衡,促使生成高频词汇/短语,同时抑制低频但更具体的词汇/短语。本工作中,我们提出一种新颖的全局-局部判别目标,构建于参考模型之上,以促进生成细粒度的描述性描述。具体而言,从全局视角,我们设计了一种新颖的全局判别约束,将生成句子拉近,使其能更好地区分整个数据集中对应图像与其他所有图像。从局部视角,提出局部判别约束以增强注意力,从而强调低频但更具体的词汇/短语,进而促进生成能更好描述给定图像视觉细节的描述。我们在广泛使用的 MS-COCO 数据集上评估所提方法,其以可观优势超越基线方法,并与现有领先方法取得具竞争力的性能。我们还进行了自检索实验以证明所提方法的判别能力。

关键词

引用

@article{arxiv.2007.10662,
  title  = {Fine-Grained Image Captioning with Global-Local Discriminative Objective},
  author = {Jie Wu and Tianshui Chen and Hefeng Wu and Zhi Yang and Guangchun Luo and Liang Lin},
  journal= {arXiv preprint arXiv:2007.10662},
  year   = {2020}
}

备注

Accepted by TMM