多模态大语言模型中用于视频 Token 压缩的混合级指令注入
计算机视觉与模式识别
2025-03-21 v1 人工智能
计算与语言
摘要
近期多模态大语言模型(MLLMs)受到海量视频帧带来的计算开销挑战,通常通过压缩策略来缓解。然而,视觉内容对用户指令的贡献度并不均等,现有策略(例如平均池化)不可避免地会导致潜在有用信息的丢失。为解决此问题,我们提出用于 MLLM 条件 Token 压缩的混合级指令注入策略(HICom),利用指令作为条件从局部和全局两个层面指导压缩。这促使压缩在保留最大量用户关注信息的同时减少视觉 Token,以最小化计算负担。具体而言,指令条件在局部层面被注入分组的视觉 Token 中,在全局层面被注入可学习 Token 中,我们通过注意力机制完成条件压缩。通过混合级压缩,指令相关的视觉部分被突出显示,同时保留了时空结构,便于 LLM 理解。为进一步释放 HICom 的潜力,我们引入了新的条件预训练阶段以及我们提出的数据集 HICom-248K。实验表明,我们的 HICom 能以更少的 Token 取得出色的视频理解能力,在三个多选 QA 基准上平均性能提升 2.43%,且与 SOTA 方法相比节省了 78.8% 的 Token。代码可在 https://github.com/lntzm/HICom 获取。
引用
@article{arxiv.2503.16036,
title = {Hybrid-Level Instruction Injection for Video Token Compression in Multi-modal Large Language Models},
author = {Zhihang Liu and Chen-Wei Xie and Pandeng Li and Liming Zhao and Longxiang Tang and Yun Zheng and Chuanbin Liu and Hongtao Xie},
journal= {arXiv preprint arXiv:2503.16036},
year = {2025}
}
备注
Accepted to CVPR2025