检索即回答:基于冻结大语言模型的零样本视频问答
计算机视觉与模式识别
2023-06-21 v1
摘要
视频问答(VideoQA)近期因大语言模型(LLMs)的规模扩展而取得显著进展。其核心思想是将视觉信息转换至语言特征空间,从而充分释放LLMs的能力。现有VideoQA方法通常采取两种范式:(1)学习跨模态对齐,以及(2)使用现成的描述模型来描述视觉数据。然而,第一种设计需要在大量额外多模态数据上进行昂贵训练,而第二种则进一步受限于有限的领域泛化能力。为应对这些局限,我们提出了一种简单而有效的检索即回答(Retrieving-to-Answer, R2A)框架。给定输入视频,R2A首先使用预训练多模态模型(如CLIP)从通用文本语料库中检索一组语义相似文本。结合问题与检索到的文本,可直接使用LLM(如DeBERTa)得出所需答案。无需跨模态微调,R2A允许所有关键组件(如LLM、检索模型和文本语料库)即插即用。在多个VideoQA基准上的广泛实验表明,尽管仅有13亿参数且未经微调,我们的R2A仍优于参数规模大61倍、且额外在近21亿多模态数据上训练过的Flamingo-80B模型。
引用
@article{arxiv.2306.11732,
title = {Retrieving-to-Answer: Zero-Shot Video Question Answering with Frozen Large Language Models},
author = {Junting Pan and Ziyi Lin and Yuying Ge and Xiatian Zhu and Renrui Zhang and Yi Wang and Yu Qiao and Hongsheng Li},
journal= {arXiv preprint arXiv:2306.11732},
year = {2023}
}