进化而非训练:通过进化提示实现零样本推理分割
计算机视觉与模式识别
2026-01-01 v1 人工智能
摘要
推理分割要求模型解释复杂的、上下文相关的语言查询,以实现像素级定位。当前主流方法严重依赖监督微调(SFT)或强化学习(RL)。然而,SFT 存在灾难性遗忘和领域依赖问题,而 RL 则常受训练不稳定和对预定义奖励函数的刚性依赖所阻碍。尽管近期的免训练方法规避了这些训练负担,但它们从根本上受限于静态推理范式。这些方法通常依赖单次“生成-然后-分割”链,这导致推理深度不足,且缺乏自我纠正语言幻觉或空间误解的能力。在本文中,我们挑战这些局限性,并提出 EVOL-SAM3,这是一个新颖的零样本框架,将推理分割重新表述为推理时的进化搜索过程。EVOL-SAM3 不依赖固定提示,而是维护一个提示假设种群,并通过“生成-评估-进化”循环迭代地对其进行优化。我们引入了一个视觉竞技场,通过无参考的成对锦标赛来评估提示适应度,并引入了一个语义变异算子来注入多样性并纠正语义错误。此外,一个异构竞技场模块将几何先验与语义推理相结合,以确保鲁棒的最终选择。大量实验表明,EVOL-SAM3 不仅在零样本设置下大幅优于静态基线,还显著超越了在具有挑战性的 ReasonSeg 基准上的全监督最先进方法。代码可在 https://github.com/AHideoKuzeA/Evol-SAM3 获取。
引用
@article{arxiv.2512.24702,
title = {Evolving, Not Training: Zero-Shot Reasoning Segmentation via Evolutionary Prompting},
author = {Kai Ye and Xiaotong You and Jianghang Lin and Jiayi Ji and Pingyang Dai and Liujuan Cao},
journal= {arXiv preprint arXiv:2512.24702},
year = {2026}
}