中文

SynthRef:用于对象分割的合成指代表达生成

计算机视觉与模式识别 2021-06-10 v2 计算与语言 多媒体

摘要

深度学习的近期进展推动了语言引导视频对象分割等视觉定位任务的显著进步。然而,为这些任务收集大型数据集在标注时间上代价高昂,构成了瓶颈。为此,我们提出一种新方法,即 SynthRef,用于为图像(或视频帧)中的目标对象生成合成指代表达,并且我们提出并发布了首个用于视频对象分割的带合成指代表达的大规模数据集。我们的实验表明,通过使用我们的合成指代表达进行训练,可在无任何额外标注成本的情况下提升模型跨不同数据集的泛化能力。此外,我们的方法可应用于任意对象检测或分割数据集。

关键词

引用

@article{arxiv.2106.04403,
  title  = {SynthRef: Generation of Synthetic Referring Expressions for Object Segmentation},
  author = {Ioannis Kazakos and Carles Ventura and Miriam Bellver and Carina Silberer and Xavier Giro-i-Nieto},
  journal= {arXiv preprint arXiv:2106.04403},
  year   = {2021}
}

备注

Accepted as poster at the NAACL 2021 Visually Grounded Interaction and Language (ViGIL) Workshop. 4 pages. Project website: https://imatge-upc.github.io/synthref/