中文

Vamos:面向视频理解的通用动作模型

计算机视觉与模式识别 2024-07-16 v3 人工智能

摘要

是什么构成了视频理解的良好表征,例如预测未来活动或回答视频条件问答?尽管早期方法侧重于直接从视频像素进行端到端学习,我们提议重新审视基于文本的表征,如通用视频描述,其具有可解释性且可被大型语言模型(LLMs)直接消费。直观上,不同的视频理解任务可能需要互补且粒度不同的表征。为此,我们提出通用动作模型(Vamos),这是一个以大型语言模型为“推理器”的学习框架,可灵活利用视觉嵌入与自由文本描述作为输入。为解释问答中的重要文本证据,我们将概念瓶颈模型推广到适用于token和非线性模型的情形,其使用硬注意力从自由文本中选取一小部分token作为LLM推理器的输入。我们在Ego4D、NeXT-QA、IntentQA、Spacewalk-18和EgoSchema五个互补基准上评估Vamos在时序动态建模、视觉历史编码和推理方面的能力。令人惊讶地,我们观察到基于文本的表征在所有基准上始终取得有竞争力的性能,而视觉嵌入仅带来边际或零性能提升,展示了LLM时代基于文本的 video 表征的有效性。我们还证明,我们的token瓶颈模型能够从自由文本中选取相关证据、支持测试时干预,并在保持有竞争力问答性能的同时实现近5倍推理加速。代码与模型已公开于 https://brown-palm.github.io/Vamos/

关键词

引用

@article{arxiv.2311.13627,
  title  = {Vamos: Versatile Action Models for Video Understanding},
  author = {Shijie Wang and Qi Zhao and Minh Quan Do and Nakul Agarwal and Kwonjoon Lee and Chen Sun},
  journal= {arXiv preprint arXiv:2311.13627},
  year   = {2024}
}

备注

Accepted to ECCV 2024 (European Conference on Computer Vision). Code and models are released at https://brown-palm.github.io/Vamos/