中文

看、背诵、再作答:通过自生成知识提示提升视觉语言模型性能

计算机视觉与模式识别 2025-12-04 v3 人工智能

摘要

视觉语言模型(VLM)在专业领域如精密农业中存在显著性能平台,主要由于“推理驱动的幻觉”,即语言先验会压倒视觉感知。关键瓶颈是“模态间隙”:视觉嵌入未能可靠地激活模型参数中已编码的细粒度专家知识。我们提出“看、背诵、再作答”,一种参数高效框架,通过自生成知识提示提升 VLM 性能,同时保持骨干模型冻结。该框架将推理解耦为三个阶段:(1)Look 生成客观的视觉描述和候选集;(2)Recite 采用轻量级 1.7B 路由器,将视觉线索转化为针对性查询,以触发候选特定的参数化知识;(3)Answer 执行描述与背诵知识之间的平行证据对齐,以选择最一致的标签。在 AgroBench 上,我们的方法实现了最新水平结果,使杂草识别准确率相较 Qwen2-VL-72B 提升 23.52%,并在无外部搜索开销的情况下超越 GPT-4o。这种模块化设计通过将被动感知转化为主动、可控的知识检索,缓解了幻觉问题。

关键词

引用

@article{arxiv.2512.00882,
  title  = {Look, Recite, Then Answer: Enhancing VLM Performance via Self-Generated Knowledge Hints},
  author = {Xisheng Feng},
  journal= {arXiv preprint arXiv:2512.00882},
  year   = {2025}
}