中文

如何(不)集成 LVLMs 用于 VQA

计算机视觉与模式识别 2023-12-08 v2

摘要

本文研究了大视觉-语言模型(LVLMs)时代的集成方法。集成是一种将不同模型组合以获得性能提升的经典方法。在近期关于 Encyclopedic-VQA 的工作中,作者考察了多种模型来解决其任务:从原生 LVLMs,到将描述作为额外上下文的模型,再到借助基于 Lens 的维基百科页面检索增强的模型。直观上这些模型高度互补,理应使其成为集成的理想对象。事实上,一个 oracle 实验显示出从 48.8% 准确率(最佳单一模型)到 67%(最佳可能集成)的潜在增益。因此,构建一个具有实质性实际增益的集成似乎是轻而易举之事。抑或并非如此?

关键词

引用

@article{arxiv.2310.06641,
  title  = {How (not) to ensemble LVLMs for VQA},
  author = {Lisa Alazraki and Lluis Castrejon and Mostafa Dehghani and Fantine Huot and Jasper Uijlings and Thomas Mensink},
  journal= {arXiv preprint arXiv:2310.06641},
  year   = {2023}
}

备注

4th I Can't Believe It's Not Better Workshop (co-located with NeurIPS 2023)