ChatVideo:一种以轨迹片段为中心的多模态通用视频理解系统
计算机视觉与模式识别
2023-05-02 v2
摘要
现有深度视频模型受限于特定任务、固定输入输出空间及较弱的泛化能力,难以部署于真实场景。本文中,我们提出多模态通用视频理解的愿景并给出原型系统 \system。我们的系统构建于以轨迹片段(tracklet)为中心的范式之上,将轨迹片段视为基本视频单元,并采用多种视频基础模型(ViFM)标注其属性(如外观、运动等)。所有检测到的轨迹片段存于数据库并通过数据库管理器与用户交互。我们在多类真实视频上开展了广泛案例研究,证明了我们的方法在回答各类视频相关问题上的有效性。我们的项目见 https://www.wangjunke.info/ChatVideo/
引用
@article{arxiv.2304.14407,
title = {ChatVideo: A Tracklet-centric Multimodal and Versatile Video Understanding System},
author = {Junke Wang and Dongdong Chen and Chong Luo and Xiyang Dai and Lu Yuan and Zuxuan Wu and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2304.14407},
year = {2023}
}
备注
work in progress