关注图像描述模型生成的描述
计算机视觉与模式识别
2017-08-07 v3 人工智能
摘要
为了弥合人类与机器在图像理解和描述方面的差距,我们需要进一步深入了解人们如何描述感知到的场景。在本文中,我们研究了基于自下而上显著性的视觉注意力与场景描述结构中的物体指称之间的一致性。我们调查了人工撰写描述和机器生成描述的特性。随后,我们提出了一种显著性增强的图像描述模型,以研究语言模型中来自低级线索的益处。我们了解到:(1) 人类在描述中比提及较不显著的物体更早提及更显著的物体;(2) 图像描述模型的性能越好,其与人类描述的注意力一致性就越高;(3) 与基线形式相比,所提出的显著性增强模型在 MS COCO 数据库上的提升并不显著,这表明当任务在数据上得到充分学习和调优时,显式的自下而上增强并无帮助;(4) 然而,在未见数据上观察到了显著性增强模型具有更好的泛化能力。
引用
@article{arxiv.1704.07434,
title = {Paying Attention to Descriptions Generated by Image Captioning Models},
author = {Hamed R. Tavakoli and Rakshith Shetty and Ali Borji and Jorma Laaksonen},
journal= {arXiv preprint arXiv:1704.07434},
year = {2017}
}
备注
To appear in ICCV 2017