基于跨模态代理查询的指涉视频对象分割
计算机视觉与模式识别
2025-11-27 v1
摘要
指涉视频对象分割(RVOS)是一种新兴的跨模态任务,旨在生成目标对象在给定文本表达式所指代的像素级图。该方法的核心概念在于学习视觉元素与语言表达式在语义空间中的精准对齐。最近的研究方法通过条件查询实现跨模态对齐,基于变换器结构构建的查询-响应机制跟踪目标对象。然而,这些方法存在两个局限性:(1)这些条件查询缺乏帧间依赖性和变化建模,在面对显著的帧间变化时,难以实现准确的目标跟踪;(2)它们滞后地整合文本约束,可能导致视频特征聚焦于非被指代的对象。因此,我们提出一种新的RVOS架构称为ProxyFormer,引入一组代理查询来整合视觉和文本语义,并促进它们之间的语义流动。通过在视频特征编码器的多个阶段逐步更新和传播代理查询,ProxyFormer确保视频特征聚焦于感兴趣的对象。这种动态演化也有助于建立帧间依赖关系,增强对象跟踪的准确性和一致性。为缓解高计算成本,我们将跨模态交互分解为时域和空域两个维度。此外,我们设计了联合语义一致性(JSC)训练策略,以对齐代理查询与组合视频-文本对之间的语义共识。广泛的实验表明,ProxyFormer 在四个广泛使用的RVOS基准数据集上优于现有最先进的方法。
引用
@article{arxiv.2511.21139,
title = {Referring Video Object Segmentation with Cross-Modality Proxy Queries},
author = {Baoli Sun and Xinzhu Ma and Ning Wang and Zhihui Wang and Zhiyong Wang},
journal= {arXiv preprint arXiv:2511.21139},
year = {2025}
}