中文

集合枢轴学习:基于视觉基础模型的通用分段范式重构

计算机视觉与模式识别 2025-08-05 v1

摘要

本文首次提出集合枢轴学习 (Set Pivot Learning, SPL) 概念,这是一种基于视觉基础模型 (Vision Foundation Models, VFMs) 的领域泛化 (domain generalization, DG) 范式转变。传统 DG 假设在训练期间目标域不可访问,但视觉基础模型的出现使这一假设变得模糊且过时。传统 DG 假设在训练期间目标域不可访问,但基于视觉基础模型的出现,这些模型训练于广泛且多样化的数据集,使这一假设变得模糊且过时。为应对这一挑战,我们提出集合枢轴学习 (SPL),这是一种基于 VFMs 的领域迁移任务的新定义,更适用于当前的研究和应用需求。不同于传统 DG 方法,SPL 强调自适应细化而非刚性域迁移,确保与不断演变的现实条件保持持续对齐。具体而言,SPL 具有两个关键属性:(i) 动态适应, transitioning 从静态域对齐到灵活、任务驱动的特征优化,使模型能随下游情景演化;(ii) 基于 VFM 的调优,利用预训练知识作为枢轴,以保持跨域鲁棒性的同时精炼任务特定表征。基于 SPL,我们提出了动态提示微调方法,结合动态类别感知提示器 (Dynamic Class-aware Prompter) 与提示引导特征聚焦器 (Prompt-guided Feature Focuser),以提升 VFMs 在特定情景中的性能。大量基准实验表明,我们的方法有效且优于当前最先进的方法,尤其在通用分段方面表现突出。

关键词

引用

@article{arxiv.2508.01582,
  title  = {Set Pivot Learning: Redefining Generalized Segmentation with Vision Foundation Models},
  author = {Xinhui Li and Xinyu He and Qiming Hu and Xiaojie Guo},
  journal= {arXiv preprint arXiv:2508.01582},
  year   = {2025}
}