中文

Quizard@INOVA挑战赛2025——A赛道:交错多图像模型中的即插即用技术

计算机视觉与模式识别 2025-06-16 v1 计算与语言 多媒体

摘要

本文回应两个主要目标。首先,我们展示了LLaVA-NeXT-interleave在22个数据集上三种不同任务(多图像推理、文档与知识型理解以及交互式多模态通信)中的出色性能。其次,我们在LLaVA-NeXT-Interleave中添加了密集通道集成(DCI)连接器,并将其性能与标准模型进行比较。我们发现标准模型取得了最高的总体准确率,在VISION、NLVR2和Fashion200K等视觉密集型任务中表现出色。同时,DCI增强版本在需要更深语义一致性或结构化变化理解的数据集(如MIT-States_PropertyCoherence和SlideVQA)上表现出特别的优势。我们的结果展示了将强大基础模型与即插即用技术相结合用于交错任务的潜力。代码可在https://github.com/dinhvietcuong1996/icme25-inova获取。

关键词

引用

@article{arxiv.2506.11737,
  title  = {Quizzard@INOVA Challenge 2025 -- Track A: Plug-and-Play Technique in Interleaved Multi-Image Model},
  author = {Dinh Viet Cuong and Hoang-Bao Le and An Pham Ngoc Nguyen and Liting Zhou and Cathal Gurrin},
  journal= {arXiv preprint arXiv:2506.11737},
  year   = {2025}
}