面向文本丰富图像理解的多模态大语言模型: 综合综述
计算机视觉与模式识别
2025-02-25 v1
摘要
近期, 多模态大语言模型 (MLLMs) 的出现为文本丰富图像理解 (TIU) 领域带来了新的维度, 模型展现出令人印象深刻且鼓舞人心的性能. 然而, 其快速演化与广泛采用使得跟踪最新进展变得日益困难. 为此, 我们呈现一项系统且全面的调查, 以促进 TIU MLLMs 的进一步研究. 首先, 我们概述了 nearly all TIU MLLMs 的时间线、架构与管线. 随后, 我们审查了所选模型在主流基准上的性能. 最后, 我们探讨了该领域的若干前景方向、挑战与局限性.
引用
@article{arxiv.2502.16586,
title = {Multimodal Large Language Models for Text-rich Image Understanding: A Comprehensive Review},
author = {Pei Fu and Tongkun Guan and Zining Wang and Zhentao Guo and Chen Duan and Hao Sun and Boming Chen and Jiayao Ma and Qianyi Jiang and Kai Zhou and Junfeng Luo},
journal= {arXiv preprint arXiv:2502.16586},
year = {2025}
}