中文

IIU:面向知识型视觉问答的独立推理单元

计算机视觉与模式识别 2024-08-16 v1 人工智能

摘要

知识型视觉问答需要超出可见内容的外部知识来正确回答问题。现有方法的局限之一是它们更关注建模跨模态和模态内相关性,通过隐式嵌入纠缠复杂的多模态线索,缺乏可解释性和泛化能力。解决上述问题的关键是在功能层面分离信息并分别处理。通过复用每个处理单元,模型处理不同数据的泛化能力可以增强。在本文中,我们提出独立推理单元(IIU)用于细粒度多模态推理,以功能独立的单元分解模态内信息。具体而言,IIU 通过独立的推理单元处理每个语义特定的模态内线索,同时也通过不同单元之间的通信收集互补信息。为进一步减少冗余信息的影响,我们提出一个记忆更新模块,在推理过程中逐步维护语义相关记忆。与标准数据集上现有的非预训练多模态推理模型相比,我们的模型达到了新的最先进水平,性能提升 3%,超越了基础预训练多模态模型。实验结果表明我们的 IIU 模型在解耦模态内线索和推理单元方面有效,能够提供可解释的推理证据。我们的代码可在 https://github.com/Lilidamowang/IIU 获取。

关键词

引用

@article{arxiv.2408.07989,
  title  = {IIU: Independent Inference Units for Knowledge-based Visual Question Answering},
  author = {Yili Li and Jing Yu and Keke Gai and Gang Xiong},
  journal= {arXiv preprint arXiv:2408.07989},
  year   = {2024}
}