中文

以语言为媒介:仅通过文本实现多模态视频分类

计算机视觉与模式识别 2023-09-20 v1 人工智能 计算与语言

摘要

尽管多模态机器学习模型迎来了令人振奋的新浪潮,现有方法仍难以解释视频中不同模态之间复杂的上下文关系。超越强调简单动作或物体的已有方法,我们提出一种与模型无关的崭新方法,用于生成捕捉多模态视频信息的详尽文本描述。我们的方法利用 GPT-3.5 或 Llama2 等大型语言模型所学到的广博知识,对来自 BLIP-2、Whisper 和 ImageBind 的视觉与听觉模态文本描述进行推理。无需额外微调视频-文本模型或数据集,我们证明现有的 LLM 能够将这些多模态文本描述用作“视觉”或“听觉”的代理,并在上下文中对视频进行零样本多模态分类。我们在 UCF-101 或 Kinetics 等流行的动作识别基准上的评估表明,这些富含上下文的描述可成功用于视频理解任务。该方法指向多模态分类中一个大有前景的新研究方向,展示了文本、视觉与听觉机器学习模型之间的相互作用如何实现更整体的视频理解。

关键词

引用

@article{arxiv.2309.10783,
  title  = {Language as the Medium: Multimodal Video Classification through text only},
  author = {Laura Hanu and Anita L. Verő and James Thewlis},
  journal= {arXiv preprint arXiv:2309.10783},
  year   = {2023}
}

备注

Accepted at "What is Next in Multimodal Foundation Models?" (MMFM) workshop at ICCV 2023