中文

语言模型理解时间吗?

计算机视觉与模式识别 2025-02-25 v3 人工智能 机器学习

摘要

大语言模型(LLM)已经彻底改变了基于视频的计算机视觉应用,包括动作识别、异常检测和视频摘要。视频本身带来了独特的挑战,将空间复杂性与时间动态相结合,而这些在静态图像或文本数据中是不存在的。当前使用LLM进行视频理解的方法通常依赖预训练的视频编码器来提取时空特征,以及文本编码器来捕获语义含义。这些表示被集成到LLM框架中,使得跨多种视频任务的多模态推理成为可能。然而,一个关键问题仍然存在:LLM能否真正理解时间的概念,以及它们能多有效地推理视频中的时间关系?本文批判性地审视了LLM在视频处理中的作用,特别关注其时间推理能力。我们指出了LLM与预训练编码器交互中的关键局限性,揭示了它们在建模长期依赖关系和抽象时间概念(如因果关系和事件进展)方面的差距。此外,我们分析了现有视频数据集带来的挑战,包括偏差、缺乏时间标注以及限制LLM时间理解的领域特定局限性。为了弥补这些差距,我们探索了有前景的未来方向,包括LLM和编码器的共同进化、开发带有明确时间标签的丰富数据集,以及用于集成空间、时间和语义推理的创新架构。通过应对这些挑战,我们旨在推进LLM的时间理解能力,释放其在视频分析及其他领域的全部潜力。本文的GitHub仓库可在https://github.com/Darcyddx/Video-LLM找到。

关键词

引用

@article{arxiv.2412.13845,
  title  = {Do Language Models Understand Time?},
  author = {Xi Ding and Lei Wang},
  journal= {arXiv preprint arXiv:2412.13845},
  year   = {2025}
}

备注

Accepted for publication in the Companion Proceedings of the ACM Web Conference (WWW Companion 2025)