PG-Video-LLaVA:像素定位大型视频-语言模型
计算机视觉与模式识别
2023-12-14 v2 人工智能
摘要
将基于图像的大型多模态模型(LMMs)扩展到视频具有挑战性,因为视频数据本身复杂。近期将基于图像的 LMM 扩展到视频的方法要么缺乏定位能力(如 VideoChat、Video-ChatGPT、Video-LLaMA),要么未利用音频信号以获得更好的视频理解(如 Video-ChatGPT)。为解决这些不足,我们提出 PG-Video-LLaVA,首个具有像素级定位能力、通过将音频转写为文本以丰富视频上下文理解来整合音频线索的 LMM。我们的框架使用现成跟踪器和新颖定位模块,使其能根据用户指令在空间上定位视频中的物体。我们使用基于视频的生成和问答基准评估 PG-Video-LLaVA,并引入专门设计用于衡量视频中基于提示的物体定位性能的新基准。此外,我们提出使用 Vicuna 而非 Video-ChatGPT 中所用的 GPT-3.5 进行基于视频的对话基准测试,以确保结果可复现,而 GPT-3.5 的专有性质对此构成担忧。我们的框架构建于 SOTA 基于图像的 LLaVA 模型之上,并将其优势扩展到视频领域,在基于视频的对话和定位任务上取得可观增益。项目页面:https://github.com/mbzuai-oryx/Video-LLaVA
引用
@article{arxiv.2311.13435,
title = {PG-Video-LLaVA: Pixel Grounding Large Video-Language Models},
author = {Shehan Munasinghe and Rusiru Thushara and Muhammad Maaz and Hanoona Abdul Rasheed and Salman Khan and Mubarak Shah and Fahad Khan},
journal= {arXiv preprint arXiv:2311.13435},
year = {2023}
}
备注
Technical Report