OBJ2TEXT:从物体布局生成视觉描述性语言
计算机视觉与模式识别
2017-07-25 v1 计算与语言
摘要
为图像生成描述是一项近期受到广泛关注的研究任务。在本工作中,我们专注于抽象场景或物体布局的描述生成,其中提供的信息仅为一组物体及其位置。我们提出了 OBJ2TEXT,这是一种序列到序列模型,它使用 LSTM 网络将一组物体及其位置编码为输入序列,并使用 LSTM 语言模型对该表示进行解码。我们表明,尽管我们的模型将物体布局编码为序列,但它能够表示物体之间的空间关系,并生成全局连贯且语义相关的描述。我们在仅使用物体标注作为输入的物体布局描述任务中测试了我们的方法。我们进一步表明,我们的模型结合最先进的物体检测器,在标准 MS-COCO 描述任务的测试基准中,将图像描述模型的 CIDEr 分数从 0.863 提升至 0.950。
引用
@article{arxiv.1707.07102,
title = {OBJ2TEXT: Generating Visually Descriptive Language from Object Layouts},
author = {Xuwang Yin and Vicente Ordonez},
journal= {arXiv preprint arXiv:1707.07102},
year = {2017}
}
备注
Accepted at EMNLP 2017