SOC:面向指代视频对象分割的语义辅助对象聚类
计算机视觉与模式识别
2023-05-29 v1
摘要
本文通过增强视频级视觉-语言对齐来研究指代视频对象分割(RVOS)。近期方法将 RVOS 任务建模为序列预测问题,并对每一帧分别进行多模态交互与分割。然而,缺乏视频内容的全局视角导致难以有效利用帧间关系并理解描述对象时序变化的文本。为解决此问题,我们提出语义辅助对象聚类(SOC),其聚合视频内容与文本引导以进行统一的时序建模与跨模态对齐。通过将一组帧级对象嵌入与语言词元相关联,SOC 促进了跨模态与跨时间步的联合空间学习。此外,我们提出多模态对比监督,以在视频层面帮助构建良好对齐的联合空间。我们在流行的 RVOS 基准上进行了大量实验,我们的方法在所有基准上均以显著优势优于最先进的竞争对手。此外,对时序一致性的强调增强了我们的方法在处理具有时序变化的文本表达时的分割稳定性与适应性。代码将公开。
引用
@article{arxiv.2305.17011,
title = {SOC: Semantic-Assisted Object Cluster for Referring Video Object Segmentation},
author = {Zhuoyan Luo and Yicheng Xiao and Yong Liu and Shuyan Li and Yitong Wang and Yansong Tang and Xiu Li and Yujiu Yang},
journal= {arXiv preprint arXiv:2305.17011},
year = {2023}
}