中文

视觉启动对视觉-语言模型中合作行为的影响

人工智能 2026-05-07 v2 计算机视觉与模式识别

摘要

随着视觉-语言模型(Vision-Language Models, VLMs)越来越多地集成到决策系统中,理解视觉输入如何影响其行为至关重要。本文以迭代囚徒困境(Iterated Prisoner's Dilemma, IPD)为测试场景,研究了视觉启动对VLM合作行为的影响。我们考察了接触描绘行为概念(善良/助人 vs. 攻击性/自私)的图像以及颜色编码的收益矩阵是否会改变VLM的决策模式。实验在多个最先进的VLM上进行。我们进一步探索了缓解策略,包括提示修改、思维链(Chain of Thought, CoT)推理和视觉标记缩减。结果表明,VLM的行为会受到图像内容和颜色线索的影响,且不同模型的可受影响程度和缓解策略的有效性各不相同。这些发现不仅强调了在视觉丰富且安全攸关的环境中部署VLM时,鲁棒评估框架的重要性,也突显了模型间架构和训练差异如何可能导致不同的行为反应——这是一个值得进一步研究的领域。

关键词

引用

@article{arxiv.2604.27953,
  title  = {The Effects of Visual Priming on Cooperative Behavior in Vision-Language Models},
  author = {Kenneth J. K. Ong},
  journal= {arXiv preprint arXiv:2604.27953},
  year   = {2026}
}