分析仅用 LLM 方法在基于图像文档问答中的有效性
计算机视觉与模式识别
2023-09-27 v1 人工智能
摘要
近期的文档问答模型由两个关键组件构成:捕获图像中版式与视觉元素的视觉编码器,以及帮助将问题与图像上下文关联并利用外部世界知识生成准确答案的大语言模型(LLM)。然而,在这些任务中视觉编码器与语言模型的相对贡献仍不明确。考虑到指令微调 LLM 的有效性及其对新任务令人瞩目的适应能力,这一点尤为有趣。为此,我们在本工作中探究以下方面:(1)仅用 LLM 方法在文档问答任务上的有效性;(2)将文档图像中的文本信息序列化并直接输入指令微调 LLM 的策略,从而绕过显式视觉编码器的需要;(3)关于该方法可行性的详尽定量分析。我们的综合分析涵盖六个不同的基准数据集,使用了不同规模的 LLM。我们的发现表明,完全依赖 LLM 的策略在一系列数据集上取得了与最先进性能相当或极为接近的结果。我们假定该评估框架将作为指导性资源,为未来强调版式与图像内容信息根本重要性的研究工作选择合适的数据集。
引用
@article{arxiv.2309.14389,
title = {Analyzing the Efficacy of an LLM-Only Approach for Image-based Document Question Answering},
author = {Nidhi Hegde and Sujoy Paul and Gagan Madan and Gaurav Aggarwal},
journal= {arXiv preprint arXiv:2309.14389},
year = {2023}
}