LIVE:面向视觉问答的可学习上下文向量
计算与语言
2024-11-01 v3
摘要
随着语言模型的不断扩展,大型语言模型(LLMs)在上下文学习(ICL)中展现出新兴能力,使其能够通过前缀少量上下文演示(ICDs)作为上下文来解决语言任务。受这些进展的启发,研究人员扩展了这些技术,以开发具有ICL能力的大型多模态模型(LMMs)。然而,应用ICL通常面临两个主要挑战:1) 使用更多ICDs会大幅增加推理时间,2) 性能对ICDs的选择敏感。由于多模态ICDs中多种数据类型的整合和组合复杂性,这些挑战在LMMs中进一步加剧。最近,为了解决这些挑战,一些NLP研究引入了不可学习的上下文向量(ICVs),该向量从ICDs中提取有用的任务信息到一个单一向量中,然后将其插入LLM以帮助解决相应任务。然而,尽管在简单的NLP任务中有用,这些不可学习的方法无法处理像视觉问答(VQA)这样的复杂多模态任务。在本研究中,我们提出了可学习上下文向量(LIVE),以从演示中提炼关键任务信息,从而改善LMMs中的ICL性能。实验表明,与传统的ICL和其他不可学习的ICV方法相比,LIVE在VQA任务中能够显著降低计算成本,同时提高准确性。代码可在 \url{https://github.com/ForJadeForest/LIVE-Learnable-In-Context-Vector} 获取。
引用
@article{arxiv.2406.13185,
title = {LIVE: Learnable In-Context Vector for Visual Question Answering},
author = {Yingzhe Peng and Chenduo Hao and Xu Yang and Jiawei Peng and Xinting Hu and Xin Geng},
journal= {arXiv preprint arXiv:2406.13185},
year = {2024}
}