中文

用于指称视频对象分割的双向相关性驱动帧间交互 Transformer

计算机视觉与模式识别 2023-09-19 v2

摘要

指称视频对象分割(RVOS)旨在分割由语言描述在视频序列中指定的目标对象。典型的基于多模态 Transformer 的 RVOS 方法以帧独立的方式处理视频序列以降低高计算成本,然而这由于缺乏对所指对象时间一致性建模和时空表示学习的帧间交互而限制了性能。此外,缺乏充分的跨模态交互导致视觉与语言特征间相关性弱,增加了解码目标信息的难度并限制了模型性能。在本文中,我们提出一种双向相关性驱动的帧间交互 Transformer,称为 BIFIT,以解决 RVOS 中的这些问题。具体而言,我们在 Transformer 解码器中设计了一个轻量且即插即用的帧间交互模块,以高效学习所指对象的时空特征,从而更精确地解码视频序列中的对象信息并生成更准确的分割结果。此外,在多模态 Transformer 之前实现了双向视觉-语言交互模块,以增强视觉与语言特征间的关联,从而便于语言查询从视觉特征中解码更精确的对象信息并最终提升分割性能。在四个基准上的大量实验结果验证了我们的 BIFIT 相对于最先进方法的优越性以及所提模块的有效性。

关键词

引用

@article{arxiv.2307.00536,
  title  = {Bidirectional Correlation-Driven Inter-Frame Interaction Transformer for Referring Video Object Segmentation},
  author = {Meng Lan and Fu Rong and Zuchao Li and Wei Yu and Lefei Zhang},
  journal= {arXiv preprint arXiv:2307.00536},
  year   = {2023}
}