精准赋能,过度干扰:基于动态注入知识的视觉问答
计算与语言
2024-06-17 v1
摘要
在多模态任务中,视觉问答(VQA)通过解决以视觉内容为依据的自然语言问题而发挥着关键作用。基于知识的视觉问答(KBVQA)通过引入图像之外的外部知识来回应问题,从而推进了这一概念。我们提出一种方法,用于增强现有的视觉-语言转换器编码器-解码器(OFA)模型。我们的主要贡献在于通过动态三元组提取方法,从知识图谱中提取相关外部知识,并将其注入问题中。我们以灵活的数量提供知识图谱中的三元组作为上下文,以满足回答该问题的需求。经过知识增强的模型在三个不同的KBVQA数据集上,以平均4.75%的准确匹配得分提升超过当前最先进方法。通过实验和分析,我们展示了为每个问题提供可变数量的三元组相对于提供固定数量的三元组能够提高语言模型的推理能力。这一点即使针对最新的大型语言模型也同样如此。此外,我们通过展示模型在小型数据集上的SOTA表现如何通过简单微调实现,突显了其泛化能力。
引用
@article{arxiv.2406.09994,
title = {Precision Empowers, Excess Distracts: Visual Question Answering With Dynamically Infused Knowledge In Language Models},
author = {Manas Jhalani and Annervaz K M and Pushpak Bhattacharyya},
journal= {arXiv preprint arXiv:2406.09994},
year = {2024}
}
备注
16 pages, 12 figures