探索用于图像字幕的最近邻方法
计算机视觉与模式识别
2015-05-19 v1
摘要
我们探索了多种用于图像字幕的最近邻基线方法。这些方法在训练集中找到一组最近邻图像,并从中借用字幕用于查询图像。我们通过寻找最能代表从最近邻图像收集到的候选字幕集合的“共识”的字幕,为查询图像选择字幕。当使用MS COCO字幕评估服务器上的自动评估指标衡量时,这些方法与许多生成新颖字幕的近期方法表现相当。然而,人类研究表明,生成新颖字幕的方法仍优于最近邻方法。
引用
@article{arxiv.1505.04467,
title = {Exploring Nearest Neighbor Approaches for Image Captioning},
author = {Jacob Devlin and Saurabh Gupta and Ross Girshick and Margaret Mitchell and C. Lawrence Zitnick},
journal= {arXiv preprint arXiv:1505.04467},
year = {2015}
}