LLMind:基于生物启发的无训练自适应视觉语言模型表征
复变函数
2026-05-12 v2
摘要
视觉语言模型(VLM)通常假设视觉输入在整个视野上的均匀空间保真度,为无信息区域分配相同精度。相反,人类视觉既不均匀也不静态,而是自适应、选择性且资源高效。基于此,我们首次系统性分析了生物启发的视觉表征方法,为更高效和自适应的VLM提供了洞见。我们提出LLMind(Looking Like the Mind),一种新型无训练框架,模仿人类视觉中的散瞪编码和皮层放大,实现了在紧像素预算下的自适应高效表征。我们的核心思想是探索生物启发的自适应抽样策略(BASS),使能一个以莫比乌斯参数化的模块在保持全局场景结构的同时实现非均匀抽样。基于BASS,我们引入闭环语义反馈(CSF)通过测试时自适应与冻结VLM的文本信息对感知显著性进行对齐。在多样化的场景级和区域导向视觉问答基准上评估LLMind与均匀和其他抽样基线,结果显示在紧像素预算下,LLMind在VQA v2、Seed-Bench和A-OKVQA上的平均提升分别为+20%、+38%和+37%。更令人惊讶的是,LLMind仅使用1%、3%和5%的像素,即可保留最高达82%、92%和97%的全分辨率性能。此外,LLMind轻量级、即插即用,兼容现有VLM,无需架构更改。
引用
@article{arxiv.2603.14881,
title = {Vanishing of Invariant 2-Jet Differentials and Improved Hyperbolicity Degree Bounds in Dimension Two},
author = {Lei Hou and Dinh Tuan Huynh and Joël Merker and Song-Yan Xie},
journal= {arXiv preprint arXiv:2603.14881},
year = {2026}
}
备注
57 pages