中文

视觉空间描述:受控的面向空间图像到文本生成

计算机视觉与模式识别 2022-10-27 v2 计算与语言

摘要

图像到文本任务,如开放式图像描述与可控图像描述,数十年来受到广泛关注。在此,我们通过提出视觉空间描述(VSD)——一种面向空间语义的图像到文本新视角,进一步推进该方向工作。给定一幅图像及其中的两个对象,VSD 旨在生成一段聚焦于两对象间空间视角的描述。相应地,我们手动标注了一个数据集以促进对这一新引入任务的探究,并以 VL-BART 与 VL-T5 为骨干构建了若干基准编码器-解码器模型。此外,我们探究了将视觉空间关系分类(VSRC)信息融入模型的流水线式与联合端到端架构。最后,我们在基准数据集上开展实验以评估所有模型。结果表明我们的模型表现令人印象深刻,可提供准确且类人的面向空间文本描述。同时,VSRC 对 VSD 具有巨大潜力,且联合端到端架构是其更好集成选择。我们公开了数据集与代码以供研究使用。

关键词

引用

@article{arxiv.2210.11109,
  title  = {Visual Spatial Description: Controlled Spatial-Oriented Image-to-Text Generation},
  author = {Yu Zhao and Jianguo Wei and Zhichao Lin and Yueheng Sun and Meishan Zhang and Min Zhang},
  journal= {arXiv preprint arXiv:2210.11109},
  year   = {2022}
}