基于视觉文本实体知识感知的大型多模态助手提升文本-KVQA 性能
计算机视觉与模式识别
2024-10-28 v1 人工智能
计算与语言
机器学习
摘要
我们在现代大型多模态模型 (LMM) 的最新进展下,重新审视知识感知文本基视觉问答问题,即 Text-KVQA,并作出以下贡献: (i) 我们提出了VisTEL —— 一种进行视觉文本实体链接的原则方法。所提出的VisTEL 模块利用最先进的视觉文本识别引擎,并运用大型多模态模型,联合利用图像中获取的文本和视觉上下文,通过周围线索来将视觉文本实体链接到正确的知识库实体。(ii) 我们提出了KaLMA —— 一种知识感知的大型多模态助手,通过增强LMM对图像中视觉文本实体相关的知识,以获得准确答案。进一步,我们提供了对该方法与传统视觉问答、早期大型多模态模型、大型多模态模型以及先前最佳方法的全面实验分析和比较。在Text-KVQA的三个数据划分上,我们的方法以显著的 23.3% 的绝对提升超越了前所未有的 最佳方法,树立了新的 SOTA。我们将该实现公开于GitHub。
引用
@article{arxiv.2410.19144,
title = {Visual Text Matters: Improving Text-KVQA with Visual Text Entity Knowledge-aware Large Multimodal Assistant},
author = {Abhirama Subramanyam Penamakuri and Anand Mishra},
journal= {arXiv preprint arXiv:2410.19144},
year = {2024}
}
备注
Accepted to EMNLP (Main) 2024