中文

PhraseCut:真实场景下面向自然语言的图像分割

计算机视觉与模式识别 2020-08-05 v1

摘要

我们考虑给定自然语言短语分割图像区域的问题,并在一个由 77,262 张图像与 345,486 个短语-区域对组成的新数据集上研究该问题。我们的数据集构建于 Visual Genome 数据集之上,利用其现有标注生成一组具有挑战性的指称短语,并手动标注了对应区域。我们数据集中的短语对应于多个区域,描述了大量对象与物质类别及其属性,如颜色、形状、部件,以及与图像中其他实体的关系。我们的实验表明,数据集中概念的数量与多样性对现有最先进方法提出了显著挑战。我们系统地处理了这些概念的长尾特性,并提出了一种模块化方法,结合类别、属性与关系线索,优于现有方法。

关键词

引用

@article{arxiv.2008.01187,
  title  = {PhraseCut: Language-based Image Segmentation in the Wild},
  author = {Chenyun Wu and Zhe Lin and Scott Cohen and Trung Bui and Subhransu Maji},
  journal= {arXiv preprint arXiv:2008.01187},
  year   = {2020}
}

备注

Published in CVPR 2020. Code and data are released at: https://people.cs.umass.edu/~chenyun/phrasecut