中文

用于鲁棒视觉指代的上下文解耦与原型继承

计算机视觉与模式识别 2023-12-20 v1

摘要

视觉指代(VG)旨在根据给定的语言查询在图像中定位特定目标。来自上下文的判别信息对于将目标与其他物体区分开来至关重要,尤其是对于与其他物体同类的目标。然而,大多数先前的方法低估了此类信息。此外,它们通常针对标准场景(不含任何新物体)设计,这限制了它们向开放词汇场景的泛化。在本文中,我们提出了一种具有上下文解耦与原型继承的新框架,用于鲁棒视觉指代以处理两种场景。具体而言,上下文解耦将指代物特征与上下文特征解耦,从而实现它们之间更好的判别。原型继承通过原型库从解耦的视觉特征中发现并继承原型,以充分利用已见数据,尤其是针对开放词汇场景。通过在原型的解耦语言与视觉特征上利用 Hadamard 积得到的融合特征,避免了两种特征间重要性的剧烈调整,随后附以特殊标记并送入视觉 Transformer 编码器以进行边界框回归。在标准场景与开放词汇场景下均进行了大量实验。性能比较表明,我们的方法在两种场景下均优于现有方法。代码可在 https://github.com/WayneTomas/TransCP 获取。

关键词

引用

@article{arxiv.2312.11967,
  title  = {Context Disentangling and Prototype Inheriting for Robust Visual Grounding},
  author = {Wei Tang and Liang Li and Xuejing Liu and Lu Jin and Jinhui Tang and Zechao Li},
  journal= {arXiv preprint arXiv:2312.11967},
  year   = {2023}
}