Visual Madlibs:填空式图像生成与问答
计算机视觉与模式识别
2015-06-02 v1 计算与语言
摘要
在本文中,我们引入了一个新的数据集,包含 360,001 条针对 10,738 张图像的聚焦自然语言描述。该数据集,即 Visual Madlibs 数据集,是使用自动生成的填空模板收集的,这些模板旨在收集关于以下方面的针对性描述:人物与物体、它们的外观、活动和交互,以及对一般场景或其更广泛背景的推断。我们对 Visual Madlibs 数据集进行了若干分析,并展示了其在两个新的描述生成任务中的适用性:聚焦描述生成和图像的多项选择问答。使用联合嵌入和深度学习方法的实验在这些任务上显示了有前景的结果。
引用
@article{arxiv.1506.00278,
title = {Visual Madlibs: Fill in the blank Image Generation and Question Answering},
author = {Licheng Yu and Eunbyung Park and Alexander C. Berg and Tamara L. Berg},
journal= {arXiv preprint arXiv:1506.00278},
year = {2015}
}
备注
10 pages; 8 figures; 4 tables