基于图像描述符的语言模型是强大的少样本视频-语言学习器
计算机视觉与模式识别
2022-10-14 v4 人工智能
摘要
本工作的目标是构建灵活的视频-语言模型,能够从少量示例中泛化到各种视频到文本任务,例如特定领域字幕生成、问答和未来事件预测。现有的少样本视频-语言学习器仅关注编码器,导致缺少处理生成任务的视频到文本解码器。视频字幕生成器已在大规模视频-语言数据集上进行了预训练,但它们严重依赖微调,缺乏在少样本设置下为未见任务生成文本的能力。我们提出了 VidIL,一种通过图像和语言模型的少样本视频-语言学习器(few-shot Video-language Learner via Image and Language models),该模型在少样本视频到文本任务上展现出强大性能,而无需在任何视频数据集上进行预训练或微调。我们使用图像-语言模型将视频内容转换为帧字幕、对象、属性和事件短语,并将它们组合成时间结构模板。然后我们指示一个语言模型,利用包含少量上下文示例的提示(prompt),从组合内容中生成目标输出。提示的灵活性使模型能够捕获任何形式的文本输入,例如自动语音识别(ASR)转录文本。我们的实验证明了语言模型在理解视频方面的能力,涵盖了广泛的视频-语言任务,包括视频字幕生成、视频问答、视频字幕检索和视频未来事件预测。特别是在视频未来事件预测上,我们的少样本模型显著优于在大规模视频数据集上训练的最先进监督模型。代码和资源已公开用于研究目的,地址为 https://github.com/MikeWangWZHL/VidIL 。
引用
@article{arxiv.2205.10747,
title = {Language Models with Image Descriptors are Strong Few-Shot Video-Language Learners},
author = {Zhenhailong Wang and Manling Li and Ruochen Xu and Luowei Zhou and Jie Lei and Xudong Lin and Shuohang Wang and Ziyi Yang and Chenguang Zhu and Derek Hoiem and Shih-Fu Chang and Mohit Bansal and Heng Ji},
journal= {arXiv preprint arXiv:2205.10747},
year = {2022}
}