中文

重访 KRISP:面向资源受限环境的知识增强视觉语言模型轻量复现与分析

计算机视觉与模式识别 2025-11-27 v1 人工智能

摘要

Facebook AI Research 引入了 KRISP [4],该模型将结构化外部知识集成到视觉语言推理管道中。尽管该方法有效,但原始模型是为大规模工业训练开发的,计算需求高昂,且严重依赖大型 backbone。本文从不同角度重新审视 KRISP,提供一种轻量级复现方案,参数显著减少。尽管我们的复现模型性能约为原模型的 75%,但本次复现过程揭示了若干设计缺陷、现实中的注意事项以及原论文未充分覆盖的隐式问题。我们通过系统化消融研究,揭示了在资源受限条件下,知识增强型 VQA 架构的可扩展性和有效性,包括在合成 VQA 数据上的概念证研究以及在 DAQUAR 数据集上的评估。我们的模型在参数受限且依赖外部知识图谶域限制的配置下,防止了 AI 幻觉,仅生成该域内的输出。最小化的参数使我们能够在诸如智能手机和 AR-VR 设备上的功能运行,从而提高离线视觉推理能力。

关键词

引用

@article{arxiv.2511.20795,
  title  = {Revisiting KRISP: A Lightweight Reproduction and Analysis of Knowledge-Enhanced Vision-Language Models},
  author = {Souradeep Dutta and Keshav Bulia and Neena S Nair},
  journal= {arXiv preprint arXiv:2511.20795},
  year   = {2025}
}

备注

7 pages , 4 figures