RefVOS:细察视频对象分割中的指代表达式
计算机视觉与模式识别
2020-10-02 v1
摘要
带有指代表达式的视频对象分割任务(语言引导 VOS)是指,给定语言短语与视频,为短语所指对象生成二值掩码。我们的工作指出,该任务所用的现有基准主要由平凡案例构成,其中所指对象可通过简单短语识别。我们的分析依赖于将 DAVIS-2017 与 Actor-Action 数据集中的短语重新划分为平凡与非平凡指代表达式(RE),并对非平凡 RE 标注了七种 RE 语义类别。我们利用该数据分析了 RefVOS 的结果,RefVOS 是一种新颖的神经网络,在语言引导图像分割任务上取得了有竞争力的结果,并在语言引导 VOS 上取得了当前最优结果。我们的研究表明,该任务的主要挑战与理解运动及静态动作相关。
引用
@article{arxiv.2010.00263,
title = {RefVOS: A Closer Look at Referring Expressions for Video Object Segmentation},
author = {Miriam Bellver and Carles Ventura and Carina Silberer and Ioannis Kazakos and Jordi Torres and Xavier Giro-i-Nieto},
journal= {arXiv preprint arXiv:2010.00263},
year = {2020}
}