中文

用于高效知识库视觉问答的上下文压缩学习

计算机视觉与模式识别 2025-02-04 v2 机器学习

摘要

多模态大语言模型 (MLLM) 在视觉问答 (VQA) 中展现出卓越的性能。然而在知识库视觉问答 (KB-VQA) 中,MLLM 可能缺乏针对特定问题所需的专业领域知识,迫切需要从外部知识来源检索必要信息。以前的工作如 Retrival-Augmented VQA-v2 (RAVQA-v2) 关注于尽可能多地利用图像文本描述和检索到的知识以提升性能,但忽略了随着输入 token 数量增加,推理效率显著下降的问题,这与实际应用需求相矛盾。为此,我们提出了一种基于压缩上下文的检索增强 MLLM 方法,即 Retrieval-Augmented MLLMs with Compressed Contexts (RACC)。RACC 学习压缩和聚合给定图像-问题对检索到的知识,生成形式为 Key-Value (KV) 缓存的紧凑调制,以适配下游冻结的 MLLM,从而实现有效且高效的推理。RACC 在 OK-VQA 上实现了最新水平 (SOTA) 的 63.92% 性能。此外,与著名的 RAVQA-v2 相比,推理延迟降低 22.0%-59.7%。大量实验表明 RACC 拥有广泛的适用性。它与各种即插即用 MLLM 兼容,并且可以处理包括文本和多模态文档在内的不同知识来源。

关键词

引用

@article{arxiv.2409.07331,
  title  = {Learning to Compress Contexts for Efficient Knowledge-based Visual Question Answering},
  author = {Weixi Weng and Jieming Zhu and Xiaojun Meng and Hao Zhang and Rui Zhang and Chun Yuan},
  journal= {arXiv preprint arXiv:2409.07331},
  year   = {2025}
}