中文

RefineCap:用于图像描述的概念感知精化方法

计算与语言 2021-09-09 v1

摘要

自动将图像翻译为文本涉及图像场景理解与语言建模。本文提出一种新颖模型,称为 RefineCap,其利用解码器引导的视觉语义来精化语言解码器的输出词汇,并隐式学习视觉标签词与图像之间的映射。所提出的视觉概念精化方法可使生成器关注图像中的语义细节,从而生成更具语义描述性的描述。我们的模型在 MS-COCO 数据集上相较于先前基于视觉概念的模型取得了更优性能。

关键词

引用

@article{arxiv.2109.03529,
  title  = {RefineCap: Concept-Aware Refinement for Image Captioning},
  author = {Yekun Chai and Shuo Jin and Junliang Xing},
  journal= {arXiv preprint arXiv:2109.03529},
  year   = {2021}
}

备注

Accepted at ViGIL @NAACL 2021