Hunyuan-GameCraft-2:指令遵循交互式游戏世界模型
计算机视觉与模式识别
2026-02-11 v2
摘要
最近的生成式世界模型进展使我们能够在创建开放式游戏环境方面取得显著进展,从静态场景合成演变到动态、交互式模拟。 然而,当前方法仍受限于僵化的动作模式和高标注成本,限制了其对建模多样化游戏内交互和玩家驱动动态的能力。 为了解决这些挑战,我们引入Hunyuan-GameCraft-2,这是一种针对生成式游戏世界建模的新的指令驱动交互范式。 不依赖于固定的键盘输入,我们的模型允许用户通过自然语言提示、键盘或鼠标信号控制游戏视频内容,在生成的世界中实现灵活且富有语义的交互。 我们正式定义了交互式视频数据的概念,并开发了自动化过程,将大规模非结构化文本-视频对转换为因果对齐的交互数据集。 基于14B参数的图像到视频混合专家 (Mixture-of-Experts, MoE) 基础模型构建,我们的模型包含一种文本驱动的交互注入机制,用于精细控制摄像机运动、角色行为和环境动态。 我们引入了一个以交互为中心的基准,InterBench,用于全面评估交互性能。 大量实验表明,我们的模型生成的在时间上连贯且在因果上有依托的交互式游戏视频,忠实地响应各种和自由形式的用户指令,如“打开门”、“绘制火把”或“触发爆炸”。
引用
@article{arxiv.2511.23429,
title = {Hunyuan-GameCraft-2: Instruction-following Interactive Game World Model},
author = {Junshu Tang and Jiacheng Liu and Jiaqi Li and Longhuang Wu and Haoyu Yang and Penghao Zhao and Siruis Gong and Xiang Yuan and Shuai Shao and Linfeng Zhang and Qinglin Lu},
journal= {arXiv preprint arXiv:2511.23429},
year = {2026}
}
备注
Technical Report, Project page:https://hunyuan-gamecraft-2.github.io/, Demo:https://hunyuan.tencent.com/game/game-craft