中文

LVChat:促进长视频理解

计算机视觉与模式识别 2024-02-20 v1 计算与语言

摘要

使大型语言模型 (LLMs) 能够阅读视频对于多模态 LLM 至关重要。现有工作在短视频上显示出前景,但长视频(例如超过 1 分钟)的理解仍然具有挑战性。主要问题在于视频的过度压缩,即编码后的视频表示不足以代表整个视频。为解决这一问题,我们提出了长视频对话 (LVChat),其中引入了帧可扩展编码 (FSE),以动态调整嵌入的数量使其与视频时长对齐,确保长视频不会被过度压缩为少数几个嵌入。针对长度超出训练期间所见视频范围的长视频,我们提出了交错帧编码 (IFE),通过重复位置嵌入并交错多组视频来实现长视频输入,避免因视频过长而导致的性能下降。实验结果表明,LVChat 在长视频问答数据集和长视频字幕基准测试中的准确率显著优于现有方法,最高提升达 27%。我们的代码已发布在 https://github.com/wangyu-ustc/LVChat。

关键词

引用

@article{arxiv.2402.12079,
  title  = {LVCHAT: Facilitating Long Video Comprehension},
  author = {Yu Wang and Zeyuan Zhang and Julian McAuley and Zexue He},
  journal= {arXiv preprint arXiv:2402.12079},
  year   = {2024}
}

备注

17 pages; 8 figures