中文

基于交互式Transformer的孪生网络用于视频目标分割

计算机视觉与模式识别 2021-12-30 v1

摘要

半监督视频目标分割(VOS)指在给定首帧目标标注的情况下对剩余帧中的目标进行分割,近年来受到广泛关注。其核心挑战在于寻找有效方式利用过去帧的时空上下文来学习当前帧的判别性目标表示。本文提出一种新颖的、带有专门设计的交互式Transformer的孪生网络,称为SITVOS,以实现从历史帧到当前帧的有效上下文传播。在技术上,我们使用Transformer编码器与解码器分别处理过去帧和当前帧:编码器从过去帧中编码目标物体的鲁棒时空上下文,而解码器以当前帧的特征嵌入作为查询,从编码器输出中检索目标。为进一步增强目标表示,设计了特征交互模块(FIM)以促进编码器与解码器之间的信息流。此外,我们采用孪生架构提取过去帧与当前帧的主干特征,实现了特征复用,且比现有方法更高效。在三个具有挑战性的基准上的实验结果验证了SITVOS相对于最先进方法的优越性。

关键词

引用

@article{arxiv.2112.13983,
  title  = {Siamese Network with Interactive Transformer for Video Object Segmentation},
  author = {Meng Lan and Jing Zhang and Fengxiang He and Lefei Zhang},
  journal= {arXiv preprint arXiv:2112.13983},
  year   = {2021}
}