用于指代视频对象分割的语言桥接时空交互
计算机视觉与模式识别
2022-06-09 v1 多媒体
摘要
指代视频对象分割旨在为视频中由自然语言表达式所指代的对象预测前景标签。先前的方法要么依赖3D ConvNets,要么引入额外的2D ConvNets作为编码器来提取混合时空特征。然而,这些方法由于解码阶段中发生的延迟且隐式的时空交互,而遭受空间错位或错误干扰物的影响。为应对这些局限,我们提出一种语言桥接双工传输(LBDT)模块,其利用语言作为中介桥梁,在编码阶段更早地完成显式且自适应的时空交互。具体而言,在时间编码器、指代词与空间编码器之间执行跨模态注意力,以聚合并传输语言相关的运动与外观信息。此外,我们还在解码阶段提出一种双边通道激活(BCA)模块,通过通道级激活进一步去噪并突出时空一致特征。大量实验表明,我们的方法在四个流行基准上取得了新的SOTA性能,在A2D Sentences与J-HMDB Sentences上分别获得6.8%与6.9%的绝对AP增益,同时计算开销降低约7倍。
引用
@article{arxiv.2206.03789,
title = {Language-Bridged Spatial-Temporal Interaction for Referring Video Object Segmentation},
author = {Zihan Ding and Tianrui Hui and Junshi Huang and Xiaoming Wei and Jizhong Han and Si Liu},
journal= {arXiv preprint arXiv:2206.03789},
year = {2022}
}
备注
Accepted by CVPR 2022