无限视频理解
计算机视觉与模式识别
2025-07-24 v2 人工智能
信息检索
机器学习
多媒体
摘要
大型语言模型(LLM)及其多模态扩展(MLLM)的快速发展推动了视频理解领域的重大进展。然而,一个根本性挑战仍然存在:有效处理和理解持续超过几分钟甚至几小时的视频内容。尽管Video-XL-2等近期工作展示了针对极端效率的新型架构解决方案,以及HoPE和VideoRoPE++等位置编码技术旨在改进对广泛上下文环境中时空理解的效果,但当前最先进的模型在面对来自长序列的海量视觉token时仍遇到的计算和内存约束仍然显著。此外,维持时序连贯性、跟踪复杂事件以及在延长时间段内保持细粒度细节仍然是巨大的挑战,尽管Deep Video Discovery等基于智能体的推理系统取得了一些进展。本position论文认为, multimedia研究的下一 frontier(下一站点)是无限视频理解——即模型能够持续处理、理解和就任意长度、甚至永不结束的视频数据进行推理的能力。我们认为,将无限视频理解作为蓝色计划目标为multimedia以及更广泛的AI研究社区提供了关键的指南针,推动创新领域包括流式架构、持久记忆机制、层次化和自适应表示、事件中心推理以及新型评估范式。drawing inspiration自最近在长/超长视频理解以及几近相关领域的工作,我们概述了实现这一变革性能力的核心挑战和关键研究方向。
引用
@article{arxiv.2507.09068,
title = {Infinite Video Understanding},
author = {Dell Zhang and Xiangyu Chen and Jixiang Luo and Mengxi Jia and Changzhi Sun and Ruilong Ren and Jingren Liu and Hao Sun and Xuelong Li},
journal= {arXiv preprint arXiv:2507.09068},
year = {2025}
}