中文

ComboBench:大语言模型能否操控物理设备以玩虚拟现实游戏?

计算与语言 2025-10-29 v1 人工智能 人机交互 软件工程

摘要

虚拟现实(VR)游戏需要玩家将高层语义动作转化为使用控制器和头戴式显示器(HMD)进行的精确设备操作。虽然人类会基于常识和具身理解直观地完成这一转换,但大语言模型(LLM)是否能够有效复制这一能力仍未得到充分探索。本文引入了基准测试 ComboBench,评估大语言模型将语义动作转化为VR设备操作序列的能力,涵盖来自四款流行VR游戏 Half-Life: Alyx、Into the Radius、Moss: Book II 和 Vivecraft 的 262 个情景。我们评估了七种大语言模型,包括 GPT-3.5、GPT-4、GPT-4o、Gemini-1.5-Pro、LLaMA-3-8B、Mixtral-8x7B 和 GLM-4-Flash,与标注的ground truth 以及人类水平进行比较。我们的结果表明,尽管像 Gemini-1.5-Pro 这类顶级模型 demonstrate 出强大的任务分解能力,但在程序推理和空间理解方面仍不及人类。不同游戏中的表现差异显著,表明其对互动复杂度敏感。少量示例显著提升了性能,表明大语言模型在VR操作能力方面具有潜在的针对性提升空间。我们将在 https://sites.google.com/view/combobench 发布所有材料。

关键词

引用

@article{arxiv.2510.24706,
  title  = {ComboBench: Can LLMs Manipulate Physical Devices to Play Virtual Reality Games?},
  author = {Shuqing Li and Jiayi Yan and Chenyu Niu and Jen-tse Huang and Yun Peng and Wenxuan Wang and Yepang Liu and Michael R. Lyu},
  journal= {arXiv preprint arXiv:2510.24706},
  year   = {2025}
}