中文

用于图像字幕的视觉语义相关性数据集

计算与语言 2023-05-02 v2 计算机视觉与模式识别

摘要

现代图像字幕系统严重依赖从图像中提取知识以捕捉静态故事的概念。本文中,我们提出一个用于字幕的文本视觉上下文数据集,其中公开数据集COCO Captions (Lin et al., 2014)已扩展有关于场景的信息(如图像中的物体)。由于该信息为文本形式,其可用于将任意NLP任务(如文本相似度或语义关系方法)引入字幕系统,无论是作为端到端训练策略还是基于后处理的方法。

关键词

引用

@article{arxiv.2301.08784,
  title  = {Visual Semantic Relatedness Dataset for Image Captioning},
  author = {Ahmed Sabir and Francesc Moreno-Noguer and Lluís Padró},
  journal= {arXiv preprint arXiv:2301.08784},
  year   = {2023}
}

备注

Project Page: bit.ly/project-page-paper