AdaFocus:高效长视频理解的自适应相关性-多样性采样与零缓存回看
计算机视觉与模式识别
2026-05-14 v1 人工智能
摘要
长视频理解严重受限于僵化的单次范式:现有方法要么稀疏地编码视频,造成高昂的内存和延迟成本,要么激进地压缩为稀疏帧集, irreversibly 丢弃下游推理所需的细粒度证据。Consequently,当前模型难以同时在时序覆盖性、视觉细节和计算效率之间取得平衡。我们提出 AdaFocus,一个高效框架,将长视频理解重新思考为渐进式证据获取而非一次性编码。AdaFocus 依赖两个紧密耦合的组件。首先,Query-Aware Adaptive Relevance-Diversity sampler(AdaRD)产生一个紧凑且信息丰富的视频预览,当查询缺乏可靠的局部 grounding 时,自动切换为全局聚类。其次,与缓存内存中完整帧序列不同,AdaFocus 引入不确定性触发的细化机制。当模型置信度不足时,执行有针对性的回看,从磁盘直接检索高分辨率证据,采用零缓存 I/O 设计。这将被不可逆丢弃的视觉细节转化为按需可恢复的证据,而无需为 exhaustive 预加载付出代价。在七个标准长视频基准测试上,AdaFocus 显示出显著优于强基准的效率-精度权衡。与常规稠密编码相比,AdaFocus 在提升任务性能(例如在 VideoMME 上提升 +2.59% 准确率,在 Charades-STA 上提升 +8.39% mIoU)的同时,将视觉 token 消耗降低约 33 倍,并通过零缓存磁盘检索设计消除了内存中帧预缓存的需求。这些发现表明,渐进式预览结合零缓存证据细化是可扩展多媒体推理的高效范式。
引用
@article{arxiv.2605.12954,
title = {AdaFocus: Adaptive Relevance-Diversity Sampling with Zero-Cache Look-back for Efficient Long Video Understanding},
author = {Xiao Yang and Yingzhe Ma and Haoxuan Yu and Zixin Li and Ning Qin},
journal= {arXiv preprint arXiv:2605.12954},
year = {2026}
}
备注
9 pages, 4 figures. Authors Xiao Yang and Yingzhe Ma contributed equally