Artemis:面向感知策略学习的结构化视觉推理
计算机视觉与模式识别
2026-05-28 v2
摘要
近期的强化学习框架用于视觉感知策略通常包含以自然语言表达的中间推理链。经验观察表明,这类纯语言中间推理往往会降低感知任务上的性能。我们认为,核心问题不在于推理本身,而在于推理的形式:这些推理链在非结构化的语言空间中进行语义推理,而视觉感知需要在空间和以对象为中心的空间中进行推理。为此,我们引入了 Artemis,一种进行结构化视觉推理的感知策略学习方法,其中每个中间步骤都表示为(标签、边界框)对,捕获可验证的视觉状态。这种设计使我们能够对中间状态进行显式跟踪,对提案质量进行直接监督,并避免语言基于推理引入的歧义。建立在可验证且以空间为基础的推理链之上,Artemis 提供了一个适用于多种感知任务的统一架构,而无需依赖于先前感知策略模型所依赖的任务特定设计。使用在自然图像领域中进行的 grounding 和检测样本进行训练,Artemis 能够推广到计数和几何感知任务。其核心,一个以空间为基础、以对象为中心的链式法则为可扩展且通用的感知策略提供了原则性基础。
引用
@article{arxiv.2512.01988,
title = {Artemis: Structured Visual Reasoning for Perception Policy Learning},
author = {Wei Tang and Yanpeng Sun and Shan Zhang and Weihao Bo and Xiaofan Li and Piotr Koniusz and Wei Li and Na Zhao and Zechao Li},
journal= {arXiv preprint arXiv:2512.01988},
year = {2026}
}