中文

ClawCraneNet:利用目标级关系进行基于文本的视频分割

计算机视觉与模式识别 2024-01-22 v4

摘要

基于文本的视频分割是一项具有挑战性的任务,旨在将视频中由自然语言所指代的物体分割出来。它本质上要求语义理解和细粒度的视频理解。现有方法以自下而上的方式将语言表示引入分割模型,仅在卷积网络局部感受野内进行视觉-语言交互。我们认为这种交互并不充分,因为模型在仅有局部观测的情况下几乎无法构建区域级关系,而这违背了自然语言/指代表达的描述逻辑。事实上,人们通常利用目标物体与其他物体之间的关系来进行描述,若不看完整段视频则难以理解。为解决该问题,我们模仿人类在语言引导下分割物体的方式,提出了一种新颖的自上而下方法。我们首先找出视频中的所有候选物体,然后通过解析这些高层物体之间的关系来选出被指代的物体。为精确理解关系,我们研究了三种目标级关系,即位置关系、文本引导的语义关系和时间关系。在 A2D Sentences 和 J-HMDB Sentences 上的大量实验表明,我们的方法大幅优于当前最优(SOTA)方法。定性结果也表明我们的结果更具可解释性。

关键词

引用

@article{arxiv.2103.10702,
  title  = {ClawCraneNet: Leveraging Object-level Relation for Text-based Video Segmentation},
  author = {Chen Liang and Yu Wu and Yawei Luo and Yi Yang},
  journal= {arXiv preprint arXiv:2103.10702},
  year   = {2024}
}

备注

Extended version published in https://ieeexplore.ieee.org/abstract/document/10083244