通过精心构造的数据分布特性在视频视觉语言模型中激发上下文学习
计算机视觉与模式识别
2024-10-04 v4 人工智能
计算与语言
摘要
大型语言模型(LLM)近期成功的一个主要原因是其上下文学习(in-context learning)能力,这使得能够通过用少量相关示例提示,将其快速适配到下游基于文本的任务。虽然大型视觉语言模型(VLM)最近已被开发用于需要文本和图像的任务,但它们在很大程度上缺乏针对视觉信息的上下文学习,尤其是在理解和生成关于视频的文本方面。在这项工作中,我们实现了视频上的涌现上下文学习(Emergent In-context Learning on Videos,\eilev{}),一种新颖的训练范式,它通过捕捉先前工作发现对变换器中上下文学习至关重要的预训练数据关键特性,来诱导视频和文本上的上下文学习。在我们的实验中,我们表明 \eilev{} 训练的模型在针对新颖、罕见动作的少样本视频叙述上优于其他开箱即用的 VLM。此外,我们证明这些突发分布、偏斜边缘分布和动态含义的关键特性各自在不同程度上有助于 VLM 在程序化视频叙述中的上下文学习能力。我们的结果、分析以及 \eilev{} 训练的模型产生了关于视频和文本上上下文学习涌现的众多洞见,为未来优化和扩展 VLM 以进行开放域视频理解与推理的工作奠定了基础。我们的代码和演示可在 \url{https://github.com/yukw777/EILEV} 获取。
引用
@article{arxiv.2311.17041,
title = {Eliciting In-Context Learning in Vision-Language Models for Videos Through Curated Data Distributional Properties},
author = {Keunwoo Peter Yu and Zheyuan Zhang and Fengyuan Hu and Shane Storks and Joyce Chai},
journal= {arXiv preprint arXiv:2311.17041},
year = {2024}
}
备注
16 pages, LaTeX; Accepted to EMNLP 2024 Main