部分监督的图像描述生成
计算机视觉与模式识别
2018-11-29 v2
摘要
图像描述生成模型在受限领域内描述图像内容方面正变得日益成功。然而,若这些模型要在真实场景中发挥作用——例如作为视力受损人士的辅助工具——就必须理解数量更多、种类更广的视觉概念。为解决此问题,我们利用带标签的图像和物体检测数据集,教图像描述生成模型新的视觉概念。由于图像标签和物体类别可解释为部分描述,我们将此问题表述为从部分指定的序列数据中学习。随后,我们提出一种用于训练序列模型(如循环神经网络)的新算法,该算法基于我们用有限状态自动机表示的部分指定序列。在图像描述生成的语境下,我们的方法解除了此前要求图像描述生成模型仅在图像-句子配对语料库上训练,或否则需要专用模型架构以利用替代数据模态的限制。将我们的方法应用于现有的神经描述生成模型,我们在使用 COCO 数据集的新物体描述任务上取得了最先进(state of the art)的结果。我们进一步表明,我们可以训练一个描述生成模型,从 Open Images 数据集描述新的视觉概念,同时保持有竞争力的 COCO 评估分数。
引用
@article{arxiv.1806.06004,
title = {Partially-Supervised Image Captioning},
author = {Peter Anderson and Stephen Gould and Mark Johnson},
journal= {arXiv preprint arXiv:1806.06004},
year = {2018}
}
备注
NeurIPS 2018