中文

使用游程编码对语义分割进行分词

计算机视觉与模式识别 2026-04-16 v3

摘要

本文提出了一种新的统一方法,用于图像和视频中的语义分割,通过使用语言建模将掩码输出为离散令牌序列。我们使用游程编码对分割掩码进行离散化,并调整Pix2Seq框架以学习自回归模型来输出这些令牌。我们提出了新颖的分词策略来压缩令牌序列的长度,使得将该方法扩展到视频成为可能。我们还展示了如何将实例信息纳入分词过程以执行全景分割。我们在两个特定领域的数据集上评估了我们的模型,以证明其在某些场景下与最先进技术的竞争力,尽管受到有限计算资源的严重瓶颈。我们通过提出几种有前景的方法来补充这些分析,以促进未来在通用应用中的竞争力,并通过公开我们的代码和模型来促进这一点。

关键词

引用

@article{arxiv.2602.21627,
  title  = {Tokenizing Semantic Segmentation with Run Length Encoding},
  author = {Abhineet Singh and Justin Rozeboom and Nilanjan Ray},
  journal= {arXiv preprint arXiv:2602.21627},
  year   = {2026}
}

备注

Code and models available at: https://github.com/abhineet123/p2s-video