EVCap:具外部视觉-名称记忆的检索增强图像描述用于开放世界理解
计算机视觉与模式识别
2024-04-09 v2
摘要
基于大语言模型(LLM)的图像描述具备描述训练数据中未显见物体的能力;然新颖物体频现,亟需维持最新物体知识以开放世界理解。我们引入一种高效检索增强图像描述方法,以从外部视觉-名称记忆检索得的物体名提示 LLM(EVCap),而非依赖大量数据与/或扩网络参。我们利用物体视觉与名称建易变物体知识记忆,使我们能(i)极小代价更新记忆且(ii)借轻量快训模型将检索物体名轻松增广 LLM。我们的模型仅于 COCO 数据集训练,可适域外而无需额外微调或重训。于基准与合成常识违悖数据的实验显示,EVCap 仅 3.97M 可训参,较其他基于冻结预训 LLM 方法优,性能亦竞于需广训的专家 SOTA。
引用
@article{arxiv.2311.15879,
title = {EVCap: Retrieval-Augmented Image Captioning with External Visual-Name Memory for Open-World Comprehension},
author = {Jiaxuan Li and Duc Minh Vo and Akihiro Sugimoto and Hideki Nakayama},
journal= {arXiv preprint arXiv:2311.15879},
year = {2024}
}
备注
CVPR 2024