中文

OV-Stitcher:面向训练自由的全视觉语义分割的全局上下文感知框架

计算机视觉与模式识别 2026-04-13 v2 人工智能 机器学习

摘要

训练自由的全视觉语义分割(TF-OVSS)最近因能够无需额外训练即可利用大型视觉和视觉语言模型的预训练知识进行密集预测而引起关注。然而,由于这些预训练编码器的输入分辨率有限,现有的TF-OVSS方法通常采用滑动窗口策略,对裁剪后的子图像独立处理。虽然这种方法有效地管理了高分辨率输入,但会阻止对完整图像的全局注意力,导致特征表示碎片化和受限的上下文推理。我们提出OV-Stitcher,一个训练自由的框架,通过在最终编码器块中直接拼接碎片化子图像特征来解决这一限制。通过重构来自碎片化子图像特征的注意力表示,OV-Stitcher在最终编码器块中实现全局注意力,产生连贯的上下文聚合和在空间上一致、在语义上对齐的分割图。广泛的评估在八个基准数据集上表明,OV-Stitcher为开放词汇分割建立了一个可扩展且有效的解决方案,使其在与先前训练自由基线方法相比,平均交并比(mIoU)从48.7提升至50.7。

关键词

引用

@article{arxiv.2604.08110,
  title  = {OV-Stitcher: A Global Context-Aware Framework for Training-Free Open-Vocabulary Semantic Segmentation},
  author = {Seungjae Moon and Seunghyun Oh and Youngmin Ro},
  journal= {arXiv preprint arXiv:2604.08110},
  year   = {2026}
}