图表理解的多模态信息融合:MLLMs综述--演化、局限与认知增强
计算机视觉与模式识别
2026-02-12 v1 人工智能
计算与语言
机器学习
摘要
图表理解是典型的信息融合任务,需要无缝整合图形和文本数据以提取意义。多模态大语言模型(MLLMs)的出现 revolutionized了这一领域,然而基于MLLMs的图表分析仍呈现碎片化且缺乏系统组织的局面。本综述通过结构化此新兴前沿的核心组件,提供了全面的道路图。我们首先分析了融合图表中视觉与语言信息的基本挑战。随后,我们对下游任务和数据集进行分类,引入一种新型的规范性与非规范性基准分类,以凸显领域扩展的范围。随后,我们呈现方法论的演化历程,追踪从经典深度学习技术到利用高级融合策略的SOTA MLLM范式的演进。通过批判性地审视当前模型的局限性,尤其是其感知与推理缺陷,我们确定了包括高级对齐技术和强化学习等在内的有前景的未来方向。本综述旨�为研究人员和实践者提供结构化的理解,揭示MLLMs如何变革图表信息融合,并催化更稳健可靠系统的进展。
引用
@article{arxiv.2602.10138,
title = {Multimodal Information Fusion for Chart Understanding: A Survey of MLLMs -- Evolution, Limitations, and Cognitive Enhancement},
author = {Zhihang Yi and Jian Zhao and Jiancheng Lv and Tao Wang},
journal= {arXiv preprint arXiv:2602.10138},
year = {2026}
}