从秒到小时:综述多模态大语言模型对长视频的全面理解
计算机视觉与模式识别
2024-12-04 v2 人工智能
摘要
大语言模型(LLMs)与视觉编码器的集成近期在视觉理解任务中展现出可喜的性能,利用其固有的理解和生成类人文本来进行视觉推理的能力。鉴于视觉数据的多样性,多模态大语言模型(MM-LLMs)在理解图像、短视频和长视频的模型设计和训练方面表现出差异。我们的论文重点关注长视频理解相较于静态图像和短视频理解所存在的实质性差异与独特挑战。与静态图像不同,短视频包含具有空间和事件内时间信息的连续帧,而长视频则由多个事件组成,包含事件间和长期时间信息。在这项综述中,我们旨在追踪和总结 MM-LLMs 从图像理解到长视频理解的发展。我们回顾了各种视觉理解任务之间的差异,并强调了长视频理解中的挑战,包括更细粒度的时空细节、动态事件和长期依赖关系。然后,我们详细总结了 MM-LLMs 在理解长视频的模型设计和训练方法方面的进展。最后,我们比较了现有 MM-LLMs 在不同长度视频理解基准上的性能,并讨论了 MM-LLMs 在长视频理解方面的潜在未来方向。
引用
@article{arxiv.2409.18938,
title = {From Seconds to Hours: Reviewing MultiModal Large Language Models on Comprehensive Long Video Understanding},
author = {Heqing Zou and Tianze Luo and Guiyang Xie and Victor and Zhang and Fengmao Lv and Guangcong Wang and Junyang Chen and Zhuochen Wang and Hansheng Zhang and Huaijian Zhang},
journal= {arXiv preprint arXiv:2409.18938},
year = {2024}
}
备注
11 pages