利用时序感知适应的视觉语言预训练模型用于指涉视频目标分割
计算机视觉与模式识别
2024-09-24 v2
摘要
指涉视频目标分割(RVOS)的核心在于建模文本-视频的稠密关系,将抽象的语言概念与动态的视觉内容在像素级别进行关联。当前的RVOS方法通常将独立预训练的视觉和语言模型作为主干网络。由于图像和文本被映射到非耦合的特征空间,这些方法面临着从头学习视觉语言(VL)关系建模的艰巨任务。鉴于视觉语言预训练(VLP)模型的成功,我们提出了基于其对齐VL特征空间进行RVOS关系建模的方法。然而,将VLP模型迁移到RVOS任务却是一个误导性的挑战,原因在于预训练任务(静态图像/区域级预测)与RVOS任务(动态像素级预测)之间存在显著的差距。为解决此迁移挑战,我们引入了称为VLP-RVOS的框架,通过时序感知适应方法利用VLP模型进行RVOS。我们首先提出了时序感知提示调优方法,不仅为像素级预测适配预训练表示,还使视觉编码器能够建模时序上下文。我们进一步自定义了立方体框架注意力机制,以实现稳健的时空推理。此外,我们提出在特征提取过程中及其之后进行多阶段VL关系建模,以实现全面的VL理解。大量实验表明,我们的方法在与最先进算法方面表现优异,并展现出强大的泛化能力。
引用
@article{arxiv.2405.10610,
title = {Harnessing Vision-Language Pretrained Models with Temporal-Aware Adaptation for Referring Video Object Segmentation},
author = {Zikun Zhou and Wentao Xiong and Li Zhou and Xin Li and Zhenyu He and Yaowei Wang},
journal= {arXiv preprint arXiv:2405.10610},
year = {2024}
}