中文

层次化视觉代理:用于高级图表推理的联合图像-文本空间上下文管理

计算机视觉与模式识别 2026-05-07 v1 计算与语言

摘要

高级图表问答需要对微小视觉元素进行精确感知,并跨越多个子图进行多步推理。虽然现有大型多模态语言模型在理解单个子图方面表现突出,但常常在跨多个子图的多步推理方面受限。我们提出了 HierVA(Hierarchical Visual Agent)框架,用于图表推理,该框架在联合图像-文本空间中迭代构建和更新工作上下文。高层管理器生成计划并维护仅包含关键信息的紧凑上下文,而专用 worker 执行推理、收集证据并返回结果。具体而言,代理维护独立的视觉与文本上下文,利用放大工具限制视觉上下文。基于 CharXiv 推理子集的实验表明,层次化架构、受限视觉上下文和精炼后的上下文均可为强大的多模态基线带来持续的性能提升,消融实验验证了这些改进互为补充。

关键词

引用

@article{arxiv.2605.04304,
  title  = {Hierarchical Visual Agent: Managing Contexts in Joint Image-Text Space for Advanced Chart Reasoning},
  author = {Qihua Dong and Ruozhen He and Junwen Chen and Yizhou Wang and Xu Ma and Songyao Jiang and Yun Fu},
  journal= {arXiv preprint arXiv:2605.04304},
  year   = {2026}
}

备注

Accepted to ACL 2026