中文

生成室内场景的多句语言描述

计算机视觉与模式识别 2015-03-03 v1 计算与语言

摘要

本文提出了一种生成室内场景语言描述的新框架。尽管已有大量工作致力于解决这一问题,但以往的方法主要侧重于为每张图像生成单个句子,这对于描述复杂场景是不够的。我们试图超越这一点,生成具有多个句子的连贯描述。我们的方法在几个方面与常规方法不同:(1)一个联合推断物体、属性和关系的3D视觉解析系统;(2)从训练文本中自动学习的生成语法;(3)考虑句子间连贯性的文本生成算法。在增强的NYU-v2数据集上的实验表明,与基线相比,我们的框架可以生成自然描述,且ROUGE评分显著更高。

关键词

引用

@article{arxiv.1503.00064,
  title  = {Generating Multi-Sentence Lingual Descriptions of Indoor Scenes},
  author = {Dahua Lin and Chen Kong and Sanja Fidler and Raquel Urtasun},
  journal= {arXiv preprint arXiv:1503.00064},
  year   = {2015}
}