中文

FreeVA:离线多模态大语言模型作为免训练视频助手

计算机视觉与模式识别 2024-06-11 v2 人工智能

摘要

本文进行了一项实证研究,以重新审视多模态大语言模型的最新进展:视频助手。这项名为FreeVA的研究旨在以无需训练的方式将现有的基于图像的多模态大语言模型扩展到视频领域。该研究提供了一个基础但必须了解的基线,并揭示了几个令人惊讶的发现:1) FreeVA仅利用离线的基于图像的多模态大语言模型,无需额外训练,在零样本视频问答(例如MSVD-QA、ActivityNet-QA和MSRVTT-QA)中表现出色,甚至超越了涉及视频指令微调的最先进方法。2) 虽然主流的基于视频的多模态大语言模型通常以基于图像的多模态大语言模型(例如LLaVA)初始化,然后使用视频指令微调进行微调,但本研究表明,使用广泛采用的VideoInstruct-100K进行视频指令微调实际上并没有导致比完全不训练更好的性能。3) 现有工作中常用的评估指标会随着时间受到GPT API版本变化的显著影响。如果忽略这一点,可能会影响不同方法之间比较的公平性和一致性,并影响该领域研究人员的分析和判断。多模态大语言模型的进步目前正在蓬勃发展,吸引了众多研究人员进入该领域。我们希望这项工作能够作为一个即插即用、简单而有效的基线,鼓励在视频领域直接评估现有的多模态大语言模型,同时在一定程度上规范视频对话模型领域。此外,我们鼓励研究人员重新思考:当前的视频多模态大语言模型方法是否真的获得了超越图像多模态大语言模型的知识?代码可在https://github.com/whwu95/FreeVA获取。

关键词

引用

@article{arxiv.2405.07798,
  title  = {FreeVA: Offline MLLM as Training-Free Video Assistant},
  author = {Wenhao Wu},
  journal= {arXiv preprint arXiv:2405.07798},
  year   = {2024}
}

备注

Preprint. Work in progress