中文

开放词汇语义场景草图理解

计算机视觉与模式识别 2024-04-02 v2

摘要

我们研究机器理解抽象手绘场景草图这一尚未充分探索但基础性的视觉问题。我们引入了一种草图编码器,能够产生语义感知的特征空间,并通过测试其在语义草图分割任务上的性能来进行评估。为了训练我们的模型,我们仅依赖带有简短描述的位图草图,不需要任何像素级标注。为了获得对大量草图和类别的泛化能力,我们建立在基于 CLIP 模型预训练的视觉 Transformer 编码器之上。我们冻结文本编码器,对视觉编码器分支进行视觉提示微调,同时引入了一系列关键修改。首先,我们用值-值(v-v)自注意力块增强了经典的键-查询(k-q)自注意力块。我们模型的核心是一个两层层级网络设计,能够实现高效的语义解耦:第一层确保整体场景草图编码,第二层关注单个类别。然后,在该层级的第二层中,我们在文本和视觉分支之间引入了交叉注意力。我们的方法在分割结果上比零样本 CLIP 像素准确率高出 37 个百分点,在 FS-COCO 草图数据集上达到了 85.5%85.5\% 的准确率。最后,我们进行了一项用户研究,使我们能够识别出我们的方法需要进一步改进的地方,以协调机器与人类对场景草图的理解。

关键词

引用

@article{arxiv.2312.12463,
  title  = {Open Vocabulary Semantic Scene Sketch Understanding},
  author = {Ahmed Bourouis and Judith Ellen Fan and Yulia Gryaditskaya},
  journal= {arXiv preprint arXiv:2312.12463},
  year   = {2024}
}