中文

辨异:基于判别裁判的细粒度视觉描述生成器

计算机视觉与模式识别 2019-10-16 v1 计算与语言

摘要

本文研究了一个以自然语言描述图像对之间差异的新问题。与以往的单图像描述生成方法相比,从两个独立的视觉信息中获取语言表示具有挑战性。为此,我们提出了一种基于超卷积网络(Hyper Convolution Net)的高效编码器-解码器描述生成框架。此外,引入了一系列用于成对视觉信息融合的新颖特征融合技术,并提出一个判别裁判来评估该流程。由于缺少支持该任务的合适数据集,我们通过亚马逊众包平台(Amazon Mechanical Turk, AMT)收集并标注了一个大规模新数据集,以成对方式生成描述(共含14764张图像和26710个图像对)。该数据集是首个以自由语言提供相对差异描述的任务数据集。我们在该领域两个数据集上评估了模型的有效性,其性能大幅优于当前最优(state-of-the-art)方法。

关键词

引用

@article{arxiv.1910.06426,
  title  = {Tell-the-difference: Fine-grained Visual Descriptor via a Discriminating Referee},
  author = {Shuangjie Xu and Feng Xu and Yu Cheng and Pan Zhou},
  journal= {arXiv preprint arXiv:1910.06426},
  year   = {2019}
}