LCV2:一种面向视觉定位问答的高效免预训练框架
计算机视觉与模式识别
2024-03-26 v2 人工智能
摘要
本文在视觉-语言多模态领域,提出了一种用于视觉定位问答(Grounded Visual Question Answering)任务的 LCV2 模块化方法。该方法依赖冻结的大型语言模型(LLM)作为现成 VQA 模型与现成视觉定位(VG)模型之间的中间媒介,其中 LLM 基于设计的提示在两个模块之间转换并传递文本信息。LCV2 建立了一个集成的即插即用框架,无需任何预训练过程。该框架可在低计算资源下部署用于 VQA Grounding 任务。框架内的模块化模型允许应用各种 SOTA 预训练模型,展现出与时俱进的巨大潜力。我们在受限的计算和内存资源下进行了实验实现,在包括 GQA、CLEVR 和 VizWiz-VQA-Grounding 在内的基准数据集上评估了所提方法的性能。与基线方法的对比分析证明了 LCV2 的稳健竞争力。
引用
@article{arxiv.2401.15842,
title = {LCV2: An Efficient Pretraining-Free Framework for Grounded Visual Question Answering},
author = {Yuhan Chen and Lumei Su and Lihua Chen and Zhiwei Lin},
journal= {arXiv preprint arXiv:2401.15842},
year = {2024}
}
备注
21 pages,9 figures