视觉语言模型是否理解人类在游戏中的参与度?
计算机视觉与模式识别
2026-03-20 v1 人工智能
人机交互
摘要
从游戏视频中推断人类参与度对于游戏设计和玩家体验研究至关重要,但目前视觉-语言模型(VLM)是否能仅凭视觉线索推断此类潜在心理状态仍不明确。我们使用跨越九款第一人称射击游戏的 GameVibe Few-Shot 数据集,对三种 VLM 在六种提示策略下进行评估,包括零样本预测、基于 Flow、GameFlow、自决论和 MDA 的理论导向提示,以及检索增强提示。我们考虑两种预测任务:点预测参与度以及预测连续窗口之间参与度变化。结果表明,零样本 VLM 预测通常较弱,常未能优于简单基于每款游戏的多数类基线。内存或检索增强提示在某些设置下改善了点预测,而点对点预测在所有策略中始终难以实现。理论导向提示本身并不一定有助于改善,反而可能强化基于表面特征的捷径。这些发现表明当前 VLM 在 perception-understanding 方面存在鸿沟:尽管它们能够识别可见的游戏线索,但仍难以在不同游戏之间稳健地推断人类参与度。
引用
@article{arxiv.2603.18480,
title = {Do Vision Language Models Understand Human Engagement in Games?},
author = {Ziyi Wang and Qizan Guo and Rishitosh Singh and Xiyang Hu},
journal= {arXiv preprint arXiv:2603.18480},
year = {2026}
}