中文

nocaps:大规模新颖物体描述生成

计算机视觉与模式识别 2020-07-07 v3 人工智能 计算与语言 机器学习

摘要

图像描述生成模型在包含有限视觉概念且拥有大量图像-描述配对训练数据的数据集上已取得令人印象深刻的结果。然而,若这些模型要在真实场景中发挥作用,必须学习种类远为丰富的视觉概念,且理想情况下需更少监督。为鼓励开发能从替代数据源(如物体检测数据集)学习视觉概念的图像描述生成模型,我们提出了该任务的首个大规模基准。该基准被称为'nocaps',意为大规模新颖物体描述生成,由166,100条人工生成的描述组成,描述了来自OpenImages验证集与测试集的15,100张图像。相关训练数据包括COCO图像-描述对,以及OpenImages图像级标签与物体边界框。由于OpenImages包含的类别远多于COCO,测试图像中近400个物体类别没有或极少有相关训练描述(故称nocaps)。我们扩展现有的新颖物体描述生成模型以为该基准建立强基线,并提供分析以指导未来工作。

关键词

引用

@article{arxiv.1812.08658,
  title  = {nocaps: novel object captioning at scale},
  author = {Harsh Agrawal and Karan Desai and Yufei Wang and Xinlei Chen and Rishabh Jain and Mark Johnson and Dhruv Batra and Devi Parikh and Stefan Lee and Peter Anderson},
  journal= {arXiv preprint arXiv:1812.08658},
  year   = {2020}
}