Video-ChatGPT:通过大型视觉与语言模型实现细粒度视频理解
计算机视觉与模式识别
2024-06-11 v2
摘要
由大型语言模型(LLMs)驱动的对话智能体正在提供一种与视觉数据交互的新方式。尽管已有针对基于图像的对话模型的初步尝试,本工作通过引入 Video-ChatGPT 来解决未被充分探索的基于视频的对话领域。它是一个将适配视频的视觉编码器与 LLM 相结合的多模态模型。所得到的模型能够理解并生成关于视频的详细对话。我们引入了一个由 100,000 个视频-指令对组成的新数据集用于训练 Video-ChatGPT,该数据集通过可轻松扩展且对标注噪声鲁棒的手动与半自动化流程获取。我们还开发了一个针对基于视频的对话模型的定量评估框架,以客观分析基于视频的对话模型的优势与不足。代码:https://github.com/mbzuai-oryx/Video-ChatGPT。
引用
@article{arxiv.2306.05424,
title = {Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models},
author = {Muhammad Maaz and Hanoona Rasheed and Salman Khan and Fahad Shahbaz Khan},
journal= {arXiv preprint arXiv:2306.05424},
year = {2024}
}
备注
ACL 2024 (Main)