基于视觉自回归建模的图像分割 Seg-VAR
计算机视觉与模式识别
2025-11-18 v1
摘要
虽然视觉自回归建模(VAR)策略为图像生成带来了显著进展,但其在需要精确低层次空间感知的分割任务中仍未得到探索。鼓舞于经典 Mask2Former 系列模型的多尺度建模,我们提出了 Seg-VAR,一种重新思考分割问题作为条件自回归掩码生成问题的新框架。通过用潜在学习取代判别式学习来实现。具体而言,我们的方法包含三个核心组件:(1) 从输入图像生成潜在先验的图像编码器,(2) 具备空间感知性的 seglat(分割掩码的潜在表达式)编码器,该编码器使用位置敏感的颜色映射将分割掩码映射为离散潜在 token 以区分实例,(3) 从这些潜在表示解码器重构掩码。引入多阶段训练策略:首先通过图像-seglat 联合训练学习 seglat 表示,其次细化潜在转换,最后对齐图像编码器派生的潜在与 seglat 分布。实验表明,Seg-VAR 在各种分割任务和验证基准上超越了以往的判别式和生成式方法。通过将分割建模为顺序分层预测任务,Seg-VAR 为将自回归推理集成到空间感知视觉系统中开辟了新路径。代码将在 https://github.com/rkzheng99/Seg-VAR 上提供。
引用
@article{arxiv.2511.12594,
title = {Seg-VAR: Image Segmentation with Visual Autoregressive Modeling},
author = {Rongkun Zheng and Lu Qi and Xi Chen and Yi Wang and Kun Wang and Hengshuang Zhao},
journal= {arXiv preprint arXiv:2511.12594},
year = {2025}
}
备注
NeurIPS 2025, 22 pages