从大语言模型学习视频表征
计算机视觉与模式识别
2022-12-09 v1
摘要
我们提出 LaViLa,一种利用大语言模型(LLM)学习视频-语言表征的新方法。我们重新调整预训练LLM以条件依赖于视觉输入,并微调它们以创建自动视频解说器。我们自动生成的解说具有多项优势,包括对长视频的密集覆盖、视觉信息与文本更好的时间同步,以及文本更高的多样性。通过对比学习结合这些额外自动生成的解说所得到的视频-文本嵌入,在多个第一人称和第三人称视频任务上,无论是在零样本还是微调设定下,均优于先前的最先进方法。最值得注意的是,LaViLa在 EGTEA 分类上取得10.1%的绝对提升,在 Epic-Kitchens-100 多实例检索基准上取得5.9%的提升。此外,仅使用 Ego4D 数据集一半解说训练的 LaViLa 优于在完整数据集上训练的基线模型,并显示出随预训练数据和模型规模增加的积极缩放行为。
引用
@article{arxiv.2212.04501,
title = {Learning Video Representations from Large Language Models},
author = {Yue Zhao and Ishan Misra and Philipp Krähenbühl and Rohit Girdhar},
journal= {arXiv preprint arXiv:2212.04501},
year = {2022}
}
备注
Tech report. Project page: https://facebookresearch.github.io/LaViLa; Code is available at http://github.com/facebookresearch/LaViLa