视觉语言模型在图像堆栈中丢失视觉针:短上下文与长上下文中的注意力问题
计算与语言
2024-10-07 v3 人工智能
计算机视觉与模式识别
摘要
我们提出LoCoVQA,一个用于评估视觉语言模型(VLM)在长上下文中提取式推理的动态基准生成器。LoCoVQA为数学推理、VQA和字符识别任务的测试示例添加了日益增长的视觉上下文,包含既在分布也在分布外的干扰图像。在这些任务中,一套多样化的VLM模型随着视觉上下文长度的增加迅速失去性能,常常表现出显著的对数衰减趋势。这一测试评估了VLM在回答查询时如何忽略无关信息的能力——这在语言模型(LM)的文本领域中是一个相对容易的任务——表明当前的SOTA VLM在许多长上下文应用中缺乏这一基本能力。
引用
@article{arxiv.2406.16851,
title = {Losing Visual Needles in Image Haystacks: Vision Language Models are Easily Distracted in Short and Long Contexts},
author = {Aditya Sharma and Michael Saxon and William Yang Wang},
journal= {arXiv preprint arXiv:2406.16851},
year = {2024}
}
备注
Findings of EMNLP 2024