PixelCraft:用于结构化图像高保真视觉推理的多智能体系统
计算机视觉与模式识别
2025-09-30 v1
摘要
结构化图像(如图表和几何图)对多模态大型语言模型(MLLM)仍然具有挑战性,因为感知失误可能级联成错误的结论。中间视觉线索可以引导推理;然而,现有的基于线索的方法受限于低保真图像处理和线性、僵化的推理模式,限制了它们在复杂结构化图像任务上的有效性。在本文中,我们提出了PixelCraft,一个用于高保真图像处理和结构化图像灵活视觉推理的新颖多智能体系统。该系统由一个调度器、一个规划器、一个推理器、多个评论者以及一组视觉工具智能体组成。为实现高保真处理,我们构建了一个高质量语料库,并将一个MLLM微调为定位模型,其像素级定位在工具智能体中与传统计算机视觉(CV)算法相集成。在此基础之上,PixelCraft通过工具选择、智能体讨论和自我批评的动态三阶段工作流促进灵活的视觉推理。此外,与以往简单附加历史图像的线性推理模式不同,PixelCraft维护了一个图像记忆,允许规划器自适应地回溯早期的视觉步骤,探索替代推理分支,并在讨论期间动态调整推理轨迹。在具有挑战性的图表和几何基准上的大量实验表明,PixelCraft显著提升了先进MLLM的视觉推理性能,为结构化图像推理设定了新标准。我们的代码将发布于https://github.com/microsoft/PixelCraft。
引用
@article{arxiv.2509.25185,
title = {PixelCraft: A Multi-Agent System for High-Fidelity Visual Reasoning on Structured Images},
author = {Shuoshuo Zhang and Zijian Li and Yizhen Zhang and Jingjing Fu and Lei Song and Jiang Bian and Jun Zhang and Yujiu Yang and Rui Wang},
journal= {arXiv preprint arXiv:2509.25185},
year = {2025}
}