中文

Yanyun-3:基于视觉语言模型的跨平台策略游戏操作

人工智能 2025-11-26 v2 计算机视觉与模式识别

摘要

跨平台策略游戏自动化由于用户界面差异和动态战场环境的多样性,仍是一个挑战。现有的视觉-语言模型(VLM)在跨异构平台的泛化性差,界面理解和动作执行精度不足。我们引入Yanyun-3,一种基于VLM的智能体,将Qwen2.5-VL用于视觉推理,将UI-TARS用于界面执行。我们提出一种新颖的数据组织原则——组合粒度,以区分多模态数据(静态图像、多图像序列和视频)的样本内融合和样本间混合。该模型基于QLoRA在覆盖三个策略游戏平台的精选数据集上进行微调。最佳策略(M*V+S)相较于完全融合,在BLEU-4分数上提升12.98倍,在推理时间上降低63%。Yanyun-3能够在无需平台特定调优的情况下成功执行核心任务(如目标选择、资源分配)。我们的发现表明,结构化的多模态数据组织显著提升了VLM在具身任务中的性能。Yanyun-3为GUI自动化提供了可推广框架,其对机器人和自主系统具有更广泛的意义。

关键词

引用

@article{arxiv.2511.12937,
  title  = {Yanyun-3: Enabling Cross-Platform Strategy Game Operation with Vision-Language Models},
  author = {Guoyan Wang and Yanyan Huang and Chunlin Chen and Lifeng Wang and Yuxiang Sun},
  journal= {arXiv preprint arXiv:2511.12937},
  year   = {2025}
}

备注

32 pages, 13 figures