中文

TimeChat:一种用于长视频理解的敏感时间多模态大语言模型

计算机视觉与模式识别 2024-03-29 v2 人工智能 计算与语言

摘要

本工作提出了 TimeChat,一种专门为长视频理解设计的敏感时间多模态大语言模型。我们的模型包含两个关键的架构贡献:(1) 一个时间戳感知帧编码器,将视觉内容与每一帧的时间戳绑定;(2) 一个滑动视频 Q-Former,生成可变长度的视频 token 序列以适应不同时长的视频。此外,我们构建了一个指令微调数据集,包含 6 项任务和共 125K 个实例,以进一步提升 TimeChat 的指令跟随性能。在密集描述、时间定位和高光检测等多种视频理解任务上的实验结果表明,TimeChat 具有强大的零样本时间定位与推理能力。例如,与最先进的视频大语言模型相比,它在 YouCook2 上取得了 +9.2 的 F1 分数和 +2.8 的 CIDEr,在 QVHighlights 上取得了 +5.8 的 HIT@1,在 Charades-STA 上取得了 +27.5 的 R@1 (IoU=0.5),有望作为长视频理解任务的多功能视频助手,满足真实的用户需求。

关键词

引用

@article{arxiv.2312.02051,
  title  = {TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding},
  author = {Shuhuai Ren and Linli Yao and Shicheng Li and Xu Sun and Lu Hou},
  journal= {arXiv preprint arXiv:2312.02051},
  year   = {2024}
}

备注

CVPR 2024 camera-ready version, code is available at https://github.com/RenShuhuai-Andy/TimeChat