中文

Koala:基于关键帧条件的长视频-大语言模型

计算机视觉与模式识别 2024-05-07 v3

摘要

长视频问答是一项具有挑战性的任务,涉及识别短期活动并推理其细粒度关系。最先进的视频大语言模型(vLLMs)由于在新任务上展现出涌现能力,有望成为可行的解决方案。然而,尽管在数百万个短秒级视频上进行了训练,vLLMs仍无法理解数分钟长的视频并准确回答相关问题。为解决这一局限,我们提出了一种轻量级且自监督的方法——基于关键帧条件的长视频-LLM(Koala),该方法引入可学习的时空查询,使预训练的vLLMs能够泛化到更长的视频。我们的方法引入了两个新的分词器,它们以从稀疏视频关键帧计算的视觉标记为条件,用于理解短时和长时视频片段。我们在HowTo100M上训练了所提出的方法,并在零样本长视频理解基准上证明了其有效性,在所有任务上绝对准确率比最先进的大模型高出3-6%。令人惊讶的是,我们的实验还表明,我们的方法不仅帮助预训练的vLLM理解长视频,还提高了其在短期动作识别上的准确性。

关键词

引用

@article{arxiv.2404.04346,
  title  = {Koala: Key frame-conditioned long video-LLM},
  author = {Reuben Tan and Ximeng Sun and Ping Hu and Jui-hsien Wang and Hanieh Deilamsalehy and Bryan A. Plummer and Bryan Russell and Kate Saenko},
  journal= {arXiv preprint arXiv:2404.04346},
  year   = {2024}
}

备注

Accepted at CVPR 2024 as a poster highlight