展示、控制与叙述:一个生成可控且可定位描述的框架
计算机视觉与模式识别
2019-05-10 v3 计算与语言
摘要
当前的图像描述方法可使用黑盒架构描述图像,其行为从外部几乎不可控且难以解释。由于图像可根据目标和上下文以无限种方式描述,在复杂场景中应用描述算法需要更高程度的可控性。本文引入一种新颖的图像描述框架,可通过同时实现定位(grounding)与可控性来生成多样化描述。给定以图像区域序列或集合形式出现的控制信号,我们通过循环架构生成相应描述,该架构预测显式定位于区域的文本块,并遵循给定控制的约束。实验在 Flickr30k Entities 和 COCO Entities 上进行,后者是我们以半自动方式收集定位标注的 COCO 扩展版本。结果表明,我们的方法在可控图像描述方面取得了最先进的性能,无论是描述质量还是多样性。代码与标注公开于:https://github.com/aimagelab/show-control-and-tell。
引用
@article{arxiv.1811.10652,
title = {Show, Control and Tell: A Framework for Generating Controllable and Grounded Captions},
author = {Marcella Cornia and Lorenzo Baraldi and Rita Cucchiara},
journal= {arXiv preprint arXiv:1811.10652},
year = {2019}
}
备注
CVPR 2019