中文

大语言模型视角下的视频理解:综述

计算机视觉与模式识别 2025-11-26 v8 计算与语言

摘要

随着在线视频平台的快速增长和视频内容量的不断攀升,对专业视频理解工具的需求日益增长。鉴于大语言模型(LLM)在语言和多模态任务中的卓越能力,本综述提供了概述最新在视频理解中运用 LLM(Vid-LLM)的最新进展。Vid-LLM 的新兴能力出奇地先进,尤其是其在开放式多粒度(一般、时间和时空)推理中结合常识知识的能力,为未来的视频理解指明了希望之路。我们考察了 Vid-LLM 的独特特征和能力,将方法归类为三种主要类型:Video Analyzer x LLM、Video Embedder x LLM 和(Analyzer + Embedder) x LLM。此外,我们基于 LLM 在 Vid-LLM 中的功能,识别了五种子类型:LLM 作为 Summarizer、LLM 作为 Manager、LLM 作为 Text Decoder、LLM 作为 Regressor,以及 LLM 作为 Hidden Layer。此外,本综述对 Vid-LLM 的任务、数据集、基准测试和评估方法进行了全面研究。此外,它探索了 Vid-LLM 在各个领域的广泛应用,凸显了其在实际视频理解挑战中 remarkable 的可扩展性和多样性。最后,本综述总结了现有 Vid-LLM 的局限性,并概述了未来研究的方向。就更多信息,请读者访问位于 https://github.com/yunlong10/Awesome-LLMs-for-Video-Understanding 的存储库。

关键词

引用

@article{arxiv.2312.17432,
  title  = {Video Understanding with Large Language Models: A Survey},
  author = {Yolo Y. Tang and Jing Bi and Siting Xu and Luchuan Song and Susan Liang and Teng Wang and Daoan Zhang and Jie An and Jingyang Lin and Rongyi Zhu and Ali Vosoughi and Chao Huang and Zeliang Zhang and Pinxin Liu and Mingqian Feng and Feng Zheng and Jianguo Zhang and Ping Luo and Jiebo Luo and Chenliang Xu},
  journal= {arXiv preprint arXiv:2312.17432},
  year   = {2025}
}

备注

Accepted to IEEE Transactions on Circuits and Systems for Video Technology (TCSVT)