PhraseCut:真实场景下面向自然语言的图像分割
计算机视觉与模式识别
2020-08-05 v1
摘要
我们考虑给定自然语言短语分割图像区域的问题,并在一个由 77,262 张图像与 345,486 个短语-区域对组成的新数据集上研究该问题。我们的数据集构建于 Visual Genome 数据集之上,利用其现有标注生成一组具有挑战性的指称短语,并手动标注了对应区域。我们数据集中的短语对应于多个区域,描述了大量对象与物质类别及其属性,如颜色、形状、部件,以及与图像中其他实体的关系。我们的实验表明,数据集中概念的数量与多样性对现有最先进方法提出了显著挑战。我们系统地处理了这些概念的长尾特性,并提出了一种模块化方法,结合类别、属性与关系线索,优于现有方法。
引用
@article{arxiv.2008.01187,
title = {PhraseCut: Language-based Image Segmentation in the Wild},
author = {Chenyun Wu and Zhe Lin and Scott Cohen and Trung Bui and Subhransu Maji},
journal= {arXiv preprint arXiv:2008.01187},
year = {2020}
}
备注
Published in CVPR 2020. Code and data are released at: https://people.cs.umass.edu/~chenyun/phrasecut