Attend Before Attention:基于自回归凝视的高效可扩展视频理解
计算机视觉与模式识别
2026-03-13 v1
摘要
多模态大语言模型(MLLMs)已推动通用视频理解,但在处理长时段、高分辨率视频时仍面临挑战——它们在视觉Transformer(ViTs)或LLM中对每个像素都等方式处理,尽管存在显著的时空冗余。我们引入AutoGaze,一个轻量级模块,在ViT或MLLM处理前删除冗余图块。通过下一词预测和强化学习训练,AutoGaze自回归选择最小化的多尺度图块集合,可在用户指定的误差阈值内重构视频,在保留信息的同时消除冗余。实验证明,AutoGaze将视觉标记减少4倍至100倍,加速ViT和MLLM最高可达19倍,使其能够扩展到1000帧4K分辨率视频,并在视频基准测试中取得优异结果(例如在VideoMME上达到67.0%)。此外,我们引入HLVid:首个高分辨率、长篇视频问答基准,包含5分钟4K分辨率视频,规模后的MLLM结合AutoGaze相较于基线提升10.1%,并超过前所未有的MLLM 4.5%。项目页面:https://autogaze.github.io/。
关键词
引用
@article{arxiv.2603.12254,
title = {Attend Before Attention: Efficient and Scalable Video Understanding via Autoregressive Gazing},
author = {Baifeng Shi and Stephanie Fu and Long Lian and Hanrong Ye and David Eigen and Aaron Reite and Boyi Li and Jan Kautz and Song Han and David M. Chan and Pavlo Molchanov and Trevor Darrell and Hongxu Yin},
journal= {arXiv preprint arXiv:2603.12254},
year = {2026}
}
备注
CVPR 2026. Project page: https://autogaze.github.io/