中文

用于端到端指称视频对象分割的全Transformer架构

计算机视觉与模式识别 2023-11-21 v1

摘要

指称视频对象分割(RVOS)要求分割视频中由自然语言查询所指称的对象。现有方法主要依赖复杂流水线来处理此类跨模态任务,且未显式建模在定位所指对象中起重要作用的对象级空间上下文。因此,我们提出一个完全基于transformers构建的端到端RVOS框架,称为全Transformer装备架构(Fully Transformer-Equipped Architecture, FTEA),其将RVOS任务视为掩码序列学习问题,并将视频中所有对象视为候选对象。给定带有文本查询的视频片段,视觉-文本特征由编码器产生,而相应的像素级和词级特征依据语义相似度对齐。为捕获对象级空间上下文,我们开发了堆叠Transformer,其分别刻画每个候选对象的视觉外观,其特征图被直接解码为二值掩码序列。最后,模型寻找掩码序列与文本查询之间的最佳匹配。此外,为使候选对象生成的掩码多样化,我们对模型施加多样性损失以捕获所指对象更精确的掩码。实证研究表明所提方法在三个基准上具有优越性,例如,FETA在A2D Sentences(3782个视频)和J-HMDB Sentences(928个视频)上分别取得45.1%和38.7%的mAP;其在Ref-YouTube-VOS(3975个视频和7451个对象)上取得56.6%的J&F\mathcal{J\&F}。特别地,相较于最佳对比方法,其在前两者上P@@0.5分别提升2.1%和3.2%,而在后者上J\mathcal{J}提升2.9%。

关键词

引用

@article{arxiv.2309.11933,
  title  = {Fully Transformer-Equipped Architecture for End-to-End Referring Video Object Segmentation},
  author = {Ping Li and Yu Zhang and Li Yuan and Xianghua Xu},
  journal= {arXiv preprint arXiv:2309.11933},
  year   = {2023}
}