RefineCap:用于图像描述的概念感知精化方法
计算与语言
2021-09-09 v1
摘要
自动将图像翻译为文本涉及图像场景理解与语言建模。本文提出一种新颖模型,称为 RefineCap,其利用解码器引导的视觉语义来精化语言解码器的输出词汇,并隐式学习视觉标签词与图像之间的映射。所提出的视觉概念精化方法可使生成器关注图像中的语义细节,从而生成更具语义描述性的描述。我们的模型在 MS-COCO 数据集上相较于先前基于视觉概念的模型取得了更优性能。
引用
@article{arxiv.2109.03529,
title = {RefineCap: Concept-Aware Refinement for Image Captioning},
author = {Yekun Chai and Shuo Jin and Junliang Xing},
journal= {arXiv preprint arXiv:2109.03529},
year = {2021}
}
备注
Accepted at ViGIL @NAACL 2021