中文

CapOnImage:基于上下文的图像密集描述生成

计算机视觉与模式识别 2022-04-28 v1

摘要

现有的图像描述系统专注于为图像生成叙述性说明文字,这些文字在呈现上与图像空间分离。然而,文本也可作为图像上的装饰,用以突出关键点并增强图像的吸引力。本文中,我们引入一项名为“图像上描述”(CapOnImage)的新任务,旨在根据上下文信息在图像的不同位置生成密集描述。为充分利用周围视觉上下文为每个位置生成最合适的描述,我们提出了一种多模态预训练模型,该模型包含从易到难逐步学习文本与图像位置对应关系的多层次预训练任务。由于模型可能为邻近位置生成冗余描述,我们进一步利用邻近位置作为上下文来增强位置嵌入。针对这一新任务,我们还引入了一个大规模基准数据集 CapOnImage2M,其中包含 210 万张产品图像,每张图像平均有 4.8 条空间定位的描述。与其他图像描述模型变体相比,我们的模型在描述准确性和多样性方面均取得了最佳结果。我们将公开代码和数据集以促进未来研究。

关键词

引用

@article{arxiv.2204.12974,
  title  = {CapOnImage: Context-driven Dense-Captioning on Image},
  author = {Yiqi Gao and Xinglin Hou and Yuanmeng Zhang and Tiezheng Ge and Yuning Jiang and Peng Wang},
  journal= {arXiv preprint arXiv:2204.12974},
  year   = {2022}
}

备注

13pages, 10figures