中文

TS-LLaVA:通过缩略图与采样构建视觉 Token 的免训练视频大语言模型

计算机视觉与模式识别 2024-11-19 v1

摘要

多模态大语言模型(LLM)的最新进展在理解多模态内容方面取得了巨大成功。对于视频理解任务,由于缺乏高质量、经过筛选的视频-文本配对数据,基于训练的视频 LLM 难以构建。相比之下,图像-文本配对数据更容易获取,且图像与视频之间存在显著的相似性。因此,将图像 LLM 扩展用于视频理解任务是一种极具吸引力的替代方案。开发有效的策略来压缩来自多帧的视觉 Token,是利用强大的预训练图像 LLM 的一种有前景的方法。在本工作中,我们探讨了现有压缩策略在构建免训练视频 LLM 时的局限性。这些发现促使我们提出了 TS-LLaVA 方法,该方法通过缩略图与采样策略构建视觉 Token。给定一段视频,我们从所有输入帧中选取少量等距帧来构建缩略图图像作为详细的视觉线索,并辅以从所有输入帧中采样的视觉 Token。我们的方法在多个基准测试中确立了免训练视频 LLM 中新的 SOTA 性能。值得注意的是,我们的 34B 模型在 MVBench 基准测试上优于 GPT-4V,并在极具挑战性的 MLVU 基准测试上取得了与基于训练的 72B 视频 LLM Video-LLaMA2 相当的性能。代码可在 https://github.com/tingyu215/TS-LLaVA 获取。

关键词

引用

@article{arxiv.2411.11066,
  title  = {TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models},
  author = {Tingyu Qu and Mingxiao Li and Tinne Tuytelaars and Marie-Francine Moens},
  journal= {arXiv preprint arXiv:2411.11066},
  year   = {2024}
}

备注

work in progress