用于视频目标分割的分层时空Transformer
计算机视觉与模式识别
2023-07-18 v1
摘要
本文提出一种称为 HST 的半监督视频目标分割(VOS)新框架。HST 使用最新的 Swin Transformer 与 Video Swin Transformer 提取图像与视频特征,以继承其对时空局部性的归纳偏置,而这正是时间连贯 VOS 的关键。为充分利用图像与视频特征,HST 将图像与视频特征分别视为查询与记忆。通过在多尺度上应用高效记忆读取操作,HST 生成分层特征以精确重建目标掩码。HST 在处理杂乱背景下被遮挡与快速运动物体的挑战性场景时表现出有效性与鲁棒性。特别地,HST-B 在多个流行基准上优于最先进竞争者,即 YouTube-VOS(85.0%)、DAVIS 2017(85.9%)与 DAVIS 2016(94.0%)。
引用
@article{arxiv.2307.08263,
title = {Hierarchical Spatiotemporal Transformers for Video Object Segmentation},
author = {Jun-Sang Yoo and Hongjae Lee and Seung-Won Jung},
journal= {arXiv preprint arXiv:2307.08263},
year = {2023}
}