通过训练-free 空间-时间池化与网格化提升视频大语言模型的视觉 token 表示
人工智能
2026-05-22 v1 计算机视觉与模式识别
摘要
最近的多模态大语言模型(MLLM)在显著推进视频理解任务方面取得了显著进展,但在高效压缩视觉 token 同时保持时空相互作用方面仍面临挑战。现有方法,如 LLaVA 系列,利用简单的时间池化或插值技术,忽视了视觉 token 复杂动态。为弥合这一差距,我们提出了 ST-GridPool,一种专为视频 LLM 设计的新颖训练-free 视觉 token 增强方法。我们的方法集成了金字塔时间网格化(PTG),通过层次化时间网格化捕获多粒度时空相互作用,以及基于规范的空间池化(NSP),通过 token 规范与语义丰富性之间的相关性来保留高信息视觉区域。广泛的实验表明,ST-GridPool 在各种基准测试上均能显著提升视频 LLM 的性能,而无需昂贵的重新训练。我们的方法提供了一个高效且即插即用的方法,用于改进视觉 token 表示。我们的代码可在 https://github.com/bingjunluo/ST-GridPool 获取。
关键词
引用
@article{arxiv.2605.22078,
title = {Enhancing Visual Token Representations for Video Large Language Models via Training-Free Spatial-Temporal Pooling and Gridding},
author = {Bingjun Luo and Tony Wang and Hanqi Chen and Xinpeng Ding},
journal= {arXiv preprint arXiv:2605.22078},
year = {2026}
}
备注
Accepted by ICLR 2026