中文

VidEoMT:您的 ViT 其实也是视频分割模型

计算机视觉与模式识别 2026-03-05 v3

摘要

现有的在线视频分割模型通常组合单帧分割器和复杂的专用跟踪模块。虽然有效,但这些模块引入了显著的架构复杂性和计算开销。最近的研究表明,规模足够大且进行大规模预训练的纯 Vision Transformer(ViT) 编码器可以无需专用模块即可进行准确图像分割。鼓励此观察,我们提出了 Video Encoder-only Mask Transformer(VidEoMT),一种无需专用跟踪模块的简单编码器-only 视频分割模型。为在编码器-only ViT 中实现时序建模,VidEoMT 引入了一种轻量级查询传播机制,通过重用前一帧的查询来跨帧传递信息。为平衡这一点与对新内容的适应性,采用查询融合策略,将传播的查询与一组时序无关的学习查询组合。结果,VidEoMT 在不增加复杂度的前提下实现了跟踪器的优势,实现了竞争性能,运行速度快 5 倍至 10 倍,可达每秒 160 FPS 以上,使用 ViT-L 主干网络。代码:https://www.tue-mps.org/videomt/

关键词

引用

@article{arxiv.2602.17807,
  title  = {VidEoMT: Your ViT is Secretly Also a Video Segmentation Model},
  author = {Narges Norouzi and Idil Esen Zulfikar and Niccolò Cavagnero and Tommie Kerssies and Bastian Leibe and Gijs Dubbelman and Daan de Geus},
  journal= {arXiv preprint arXiv:2602.17807},
  year   = {2026}
}

备注

CVPR 2026. Code: https://www.tue-mps.org/videomt/