眼球注视指向计算位置:基于注视的高效视觉语言模型
计算机视觉与模式识别
2025-09-23 v1
摘要
视觉语言模型(VLMs)在理解视觉内容时表现出色,但视觉标记的冗余导致推理效率下降,阻碍其在AR/VR等边缘消费设备上的实时应用。现有效率方法通常使用学习到的显著性、稀疏注意力计划或控制策略对视觉标记进行剪枝,但它们需要架构修改或访问中间激活,增加推理时间的模块,导致计算和内存开销增加,常常以牺牲准确率为代价。此外,这些方法还存在与提示和图像中感兴趣区域之间的错位问题。在没有人类指导的情况下,模型可能会关注错误的区域,错过在提示或场景变化时出现的小而高频细节。本文提出GazeVLM,一个无需训练的框架,使用人类眼球注视作为自然监督信号,在其重要性所在分配计算资源。通过提取注视驱动的感兴趣区域(ROI)并可选地与低分辨率全局视图组合,GazeVLM模拟了虫眼-周边视觉,削减冗余视觉标记,同时保留任务相关细节。我们在Qwen2.5-VL-3B/7B上的VOILA-COCO基准测试上评估了视觉问答任务,使用人类注视。答案质量由GPT-4o的两两判断和对覆盖范围、准确性、细节和流畅度的加权评分评估。效率通过标记数量和FLOPs衡量。GazeVLM在视觉标记上减少最高达93.1%,总标记数降低最高59.6%,FLOPs降低50%,同时保持比全分辨率基准更好的答案质量。我们的结果表明,将模型计算与人类注视对齐为消费级设备实现高效VLM推理提供了简单、即插即用的路径。
引用
@article{arxiv.2509.16476,
title = {Eye Gaze Tells You Where to Compute: Gaze-Driven Efficient VLMs},
author = {Qinyu Chen and Jiawen Qi},
journal= {arXiv preprint arXiv:2509.16476},
year = {2025}
}
备注
11 pages