中文

VideoChat:以对话为中心视频理解

计算机视觉与模式识别 2024-01-05 v2 计算与语言

摘要

在本文中,我们初步尝试开发一个端到端的以对话为中心的视频理解系统,称为 VideoChat。它通过可学习的神经接口集成视频基础模型与大型语言模型,在空间-时间推理、事件定位和因果关系推断方面表现出色。为指导性调优该系统,我们构建了一个以视频为中心的指令数据集,由数千个带有详细描述和对话的视频组成。该数据集强调空间-时间推理并捕获因果关系,为训练我们的以对话为中心的视频理解系统提供了宝贵资产。初步定性实验展示了我们的系统在广泛视频应用中的潜力,可作为未来以对话为中心视频理解研究的简单原型系统。访问我们的代码与数据:https://github.com/OpenGVLab/Ask-Anything

关键词

引用

@article{arxiv.2305.06355,
  title  = {VideoChat: Chat-Centric Video Understanding},
  author = {KunChang Li and Yinan He and Yi Wang and Yizhuo Li and Wenhai Wang and Ping Luo and Yali Wang and Limin Wang and Yu Qiao},
  journal= {arXiv preprint arXiv:2305.06355},
  year   = {2024}
}

备注

Technical report