面向增强视觉语言推理的动态知识集成
计算与语言
2025-01-16 v1
摘要
大型视觉语言模型(LVLMs)在多模态任务中展现了惊人的能力,但由于缺乏外部知识集成,其性能常受限,这限制了其在视觉问答和推理等知识密集型任务中的处理能力。为此,我们提出了一种新方法——针对大型视觉语言模型的自适应知识导向预训练(Adaptive Knowledge-Guided Pretraining for Large Vision-Language Models,简称 AKGP-LVLM),其在预训练和微调期间动态地将结构化和非结构化知识融入 LVLMs 中。我们的方法采用知识编码器来表示外部知识,利用检索机制选择任务相关信息,并通过动态适配器有效地对齐多模态与知识表示。我们在四个基准数据集上对方法进行评估,证明其相对于最新模型具有显著的性能提升。此外,人类评估结果也凸显了我们模型输出的正确性和相关性。广泛的分析表明,AKGP-LVLM 在鲁棒性、效率和可扩展性方面均表现出色,成为处理实际知识密集型任务的引人注目的解决方案。
引用
@article{arxiv.2501.08597,
title = {Dynamic Knowledge Integration for Enhanced Vision-Language Reasoning},
author = {Julian Perry and Surasakdi Siripong and Thanakorn Phonchai},
journal= {arXiv preprint arXiv:2501.08597},
year = {2025}
}