中文

GazeQwen: 轻量级注视条件LLM调制用于流式视频理解

计算机视觉与模式识别 2026-03-30 v1 人工智能

摘要

当前的多模态大语言模型(MLLM)即使在通过视觉叠加或文本描述提供注视线索的情况下,也无法有效利用注视信息进行视频理解。我们提出了GazeQwen,这是一种参数高效的方法,通过隐藏状态调制为开源MLLM赋予注视感知能力。其核心是一个紧凑的注视重采样器(约1-5 M可训练参数),它编码V-JEPA 2.1视频特征以及由注视点导出的位置编码,并通过前向钩子将加性残差注入选定的LLM解码器层。可选的第二训练阶段为LLM添加低秩适配器(LoRA),以实现更紧密的集成。在StreamGaze基准测试的全部10项任务上评估,GazeQwen达到了63.9%的准确率,相比相同Qwen2.5-VL-7B骨干网络(将注视作为视觉提示)提升了16.1个百分点,相比GPT-4o提升了10.5个百分点,是所有测试的开源和专有模型中得分最高的。这些结果表明,在LLM中学习在哪里注入注视比扩大模型规模或设计更好的提示更为有效。所有代码和检查点可在 https://github.com/phamtrongthang123/gazeqwen 获取。

关键词

引用

@article{arxiv.2603.25841,
  title  = {GazeQwen: Lightweight Gaze-Conditioned LLM Modulation for Streaming Video Understanding},
  author = {Trong Thang Pham and Hien Nguyen and Ngan Le},
  journal= {arXiv preprint arXiv:2603.25841},
  year   = {2026}
}