中文

LCV2:一种面向视觉定位问答的高效免预训练框架

计算机视觉与模式识别 2024-03-26 v2 人工智能

摘要

本文在视觉-语言多模态领域,提出了一种用于视觉定位问答(Grounded Visual Question Answering)任务的 LCV2 模块化方法。该方法依赖冻结的大型语言模型(LLM)作为现成 VQA 模型与现成视觉定位(VG)模型之间的中间媒介,其中 LLM 基于设计的提示在两个模块之间转换并传递文本信息。LCV2 建立了一个集成的即插即用框架,无需任何预训练过程。该框架可在低计算资源下部署用于 VQA Grounding 任务。框架内的模块化模型允许应用各种 SOTA 预训练模型,展现出与时俱进的巨大潜力。我们在受限的计算和内存资源下进行了实验实现,在包括 GQA、CLEVR 和 VizWiz-VQA-Grounding 在内的基准数据集上评估了所提方法的性能。与基线方法的对比分析证明了 LCV2 的稳健竞争力。

关键词

引用

@article{arxiv.2401.15842,
  title  = {LCV2: An Efficient Pretraining-Free Framework for Grounded Visual Question Answering},
  author = {Yuhan Chen and Lumei Su and Lihua Chen and Zhiwei Lin},
  journal= {arXiv preprint arXiv:2401.15842},
  year   = {2024}
}

备注

21 pages,9 figures