Yanyun-3:基于视觉语言模型的跨平台策略游戏操作
人工智能
2025-11-26 v2 计算机视觉与模式识别
摘要
跨平台策略游戏自动化由于用户界面差异和动态战场环境的多样性,仍是一个挑战。现有的视觉-语言模型(VLM)在跨异构平台的泛化性差,界面理解和动作执行精度不足。我们引入Yanyun-3,一种基于VLM的智能体,将Qwen2.5-VL用于视觉推理,将UI-TARS用于界面执行。我们提出一种新颖的数据组织原则——组合粒度,以区分多模态数据(静态图像、多图像序列和视频)的样本内融合和样本间混合。该模型基于QLoRA在覆盖三个策略游戏平台的精选数据集上进行微调。最佳策略(M*V+S)相较于完全融合,在BLEU-4分数上提升12.98倍,在推理时间上降低63%。Yanyun-3能够在无需平台特定调优的情况下成功执行核心任务(如目标选择、资源分配)。我们的发现表明,结构化的多模态数据组织显著提升了VLM在具身任务中的性能。Yanyun-3为GUI自动化提供了可推广框架,其对机器人和自主系统具有更广泛的意义。
关键词
引用
@article{arxiv.2511.12937,
title = {Yanyun-3: Enabling Cross-Platform Strategy Game Operation with Vision-Language Models},
author = {Guoyan Wang and Yanyan Huang and Chunlin Chen and Lifeng Wang and Yuxiang Sun},
journal= {arXiv preprint arXiv:2511.12937},
year = {2025}
}
备注
32 pages, 13 figures