通过渐进概念构建实现复杂视频对象分割
计算机视觉与模式识别
2026-03-03 v3 人工智能
摘要
我们提出了概念分割(SeC),一种以概念驱动的视频对象分割(VOS)框架, 将注意力从传统的特征匹配转向渐进构建和利用高阶、面向对象的表征。SeC 利用大规模视觉语言模型(LVLMs)整合不同帧中的视觉线索,构建稳健的概念先验。为平衡语义推理与计算开销,SeC 仅在新场景出现时激活 LVLMs,在这些点上注入概念级别的特征。为严格评估在需要高级概念推理和稳健语义理解的场景下的 VOS 方法,我们引入了语义复杂情景视频对象分割基准(SeCVOS)。SeCVOS 包含 160 个手动标注的多场景视频,旨在挑战模型处理大幅度外观变化和动态场景转换。经验评估表明,SeC 在 SeCVOS 和标准 VOS 基准上均显著优于最先进的方法,包括 SAM 2 及其高级变体。在 SeCVOS 上,SeC 相较 SAM 2.1 取得了 11.8 分的提升,建立了概念感知 VOS 的新型最先进成绩。
引用
@article{arxiv.2507.15852,
title = {Advancing Complex Video Object Segmentation via Progressive Concept Construction},
author = {Zhixiong Zhang and Shuangrui Ding and Xiaoyi Dong and Songxin He and Jianfan Lin and Junsong Tang and Yuhang Zang and Yuhang Cao and Dahua Lin and Jiaqi Wang},
journal= {arXiv preprint arXiv:2507.15852},
year = {2026}
}
备注
project page: https://rookiexiong7.github.io/projects/SeC/ ; code: https://github.com/OpenIXCLab/SeC ; dataset: https://huggingface.co/datasets/OpenIXCLab/SeCVOS