克服视觉语言模型在图表理解中的挑战:基于 XML 驱动的大语言模型解决方案的概念验证
摘要
图表在视觉传递复杂关系和过程于业务文档方面发挥着关键作用。尽管近期在视觉语言模型(VLM)用于各种图像理解任务方面取得了进展,但准确识别和提取图表中所示结构和关系仍然面临着显著挑战。本研究提出了一种基于文本的方法,绕过依赖 VLM 视觉识别能力的限制。该方法利用可编辑源文件(如 xlsx、pptx 或 docx),其中图表元素(如图形、线条、注释)被保留为文本元数据。在本概念验证中,我们从 xlsx 格式的系统设计文档中提取图表信息,并将提取的图形数据转换为大语言模型(LLM)的文本输入。该方法使 LLM 能够在无需图像处理瓶颈的情况下分析关系并生成业务问题的响应。与 VLM 基于方法的实验比较表明,所提出的文本驱动框架为需要深入理解图表结构的疑问生成更准确的答案。本研究的结果不仅限于所测试的 .xlsx 文件,还可扩展到其他包含源文件的文档中的图表(如 Office pptx 和 docx 格式)。这些发现凸显了通过直接从原始源文件中提取文本来规避 VLM 限制的可行性。通过 LLM 实现图表理解,本方法为增强实际业务场景中的工作流程效率和信息分析提供了前景的路径。
引用
@article{arxiv.2502.04389,
title = {Overcoming Vision Language Model Challenges in Diagram Understanding: A Proof-of-Concept with XML-Driven Large Language Models Solutions},
author = {Shue Shiinoki and Ryo Koshihara and Hayato Motegi and Masumi Morishige},
journal= {arXiv preprint arXiv:2502.04389},
year = {2025}
}
备注
The related code is available at \url{https://github.com/galirage/spreadsheet-intelligence}, which provides the core library developed for this research. The experimental code using this library can be found at \url{https://github.com/galirage/XMLDriven-Diagram-Understanding}