VideoAtlas: 在对数计算中导航长视频
计算机视觉与模式识别
2026-03-19 v1 人工智能
摘要
将语言模型扩展到视频引入了两个挑战:表示方面,现有方法依赖有损近似;长上下文方面,基于标题或智能体的流水线将视频压缩为文本并丢失视觉保真度。为了克服这一问题,我们引入了 VideoAtlas,一个任务无关的环境,将视频表示为分层网格,同时具备无损、可导航、可扩展、无需标题和预处理的特点。视频概览可一目了然,任何区域都可以递归缩放,相同的视觉表示统一用于视频、中间调查和智能体记忆,从头到尾消除有损文本转换。这种分层结构确保访问深度仅随视频长度对数增长。对于长上下文,递归语言模型(RLM)最近为长文本提供了强大的解决方案,但将其扩展到视觉领域需要一个可递归的结构化环境,VideoAtlas 正是提供了这一环境。VideoAtlas 作为一个马尔可夫决策过程解锁了 Video-RLM:一个并行的主-工作架构,其中主节点协调全局探索,而工作节点并发地深入分配的区域以累积无损视觉证据。我们展示了三个关键发现:(1)计算量随视频时长对数增长,由网格的结构复用带来的 30-60% 多模态缓存命中率进一步放大。(2)环境预算,通过限制最大探索深度提供了一个原则性的计算-精度超参数。(3)随问题粒度扩展的自适应计算分配。当从 1 小时扩展到 10 小时基准测试时,Video-RLM 仍然是最具时长鲁棒性的方法,准确率退化极小,证明了结构化环境导航是视频理解的一个可行且可扩展的范式。
引用
@article{arxiv.2603.17948,
title = {VideoAtlas: Navigating Long-Form Video in Logarithmic Compute},
author = {Mohamed Eltahir and Ali Habibullah and Yazan Alshoibi and Lama Ayash and Tanveer Hussain and Naeemullah Khan},
journal= {arXiv preprint arXiv:2603.17948},
year = {2026}
}