ATLAS:代理式或潜在视觉推理?一个词足以两用
计算机视觉与模式识别
2026-05-15 v1 人工智能
计算与语言
摘要
视觉推理通常伴随中间视觉状态,已成为该领域的热门方向。直接通过统一模型生成图像的 straightforward 方法虽直观,却计算昂贵且架构难以实现。近期替代方案包括通过代码或工具调用实现的代理式推理,或通过可学习隐藏嵌入实现的潜在推理。然而代理式方法因外部执行产生上下文切换延迟,潜在方法则缺乏任务泛化性,难以进行自回归并行训练。为综合两者优势并规避局限,本文提出ATLAS框架,单一个离散“词”,即功能标记(functional token),既可作为代理式操作,亦可作为潜在视觉推理单元。每个功能标记关联内部化视觉操作,无需视觉监督,仍为分词器词汇表中的标准标记,可通过下一标记预测生成。该设计避免冗余中间视觉内容生成,同时保持与基础可扩展SFT和RL训练的兼容性,无需架构或方法论修改。为进一步解决RL中功能标记稀疏问题,本文引入潜在锚定GRPO(LA-GRPO),通过对功能标记施加静态加权辅助目标实现训练稳定,提供更强梯度更新。大量实验与分析表明,ATLAS在挑战性基准测试中实现卓越性能,同时保持清晰可解释性。我们期望ATLAS为未来视觉推理研究提供新范式。
引用
@article{arxiv.2605.15198,
title = {ATLAS: Agentic or Latent Visual Reasoning? One Word is Enough for Both},
author = {Ziyu Guo and Rain Liu and Xinyan Chen and Pheng-Ann Heng},
journal= {arXiv preprint arXiv:2605.15198},
year = {2026}
}
备注
Project Page: https://atlas-oneword.github.io Code: https://github.com/ZiyuGuo99/ATLAS