Isomer:用于零样本视频对象分割的同构 Transformer
计算机视觉与模式识别
2023-08-15 v1
摘要
近期领先的零样本视频对象分割 (ZVOS) 工作致力于通过精心设计的特性融合模块并将之同等应用于多个特征阶段来整合外观与运动信息。我们的初步实验表明,借助 Transformer 强大的长程依赖建模能力,简单拼接两种模态特征并送入原始 Transformer 进行特征融合可明显提升性能,但代价是巨大计算量。通过进一步实证分析,我们发现 Transformer 在不同阶段学到的注意力依赖呈现完全不同的性质:低层阶段为全局查询无关的依赖,高层阶段为语义特定的依赖。受此观察启发,我们提出两种 Transformer 变体:i) 上下文共享 Transformer (CST),以轻量计算学习图像帧内的全局共享上下文信息;ii) 语义聚散 Transformer (SGST),分别为前景与背景建模语义关联,并通过软 token 合并机制降低计算成本。我们分别将 CST 与 SGST 用于低层与高层特征融合,构建了面向 ZVOS 任务的层级同构 Transformer 框架。与使用原始 Transformer 进行多阶段融合的基线相比,我们的方法速度提升 13 倍,并取得新的最优 ZVOS 性能。代码见 https://github.com/DLUT-yyc/Isomer。
引用
@article{arxiv.2308.06693,
title = {Isomer: Isomerous Transformer for Zero-shot Video Object Segmentation},
author = {Yichen Yuan and Yifan Wang and Lijun Wang and Xiaoqi Zhao and Huchuan Lu and Yu Wang and Weibo Su and Lei Zhang},
journal= {arXiv preprint arXiv:2308.06693},
year = {2023}
}
备注
ICCV2023