Yume-1.5:一种文本控制的交互式世界生成模型
计算机视觉与模式识别
2025-12-29 v1
摘要
最近的研究表明,使用扩散模型生成具有交互性和可探索性的世界具有前景。然而,这些方法面临参数规模过大、推理步骤冗长以及历史背景快速增长等关键挑战,严重限制了实时性能并缺乏文本控制生成能力。为此,我们提出 \method,一种新型框架,用于从单张图像或文本提示生成逼真、交互且连续的世界。\method 通过精心设计的框架支持基于键盘的世界探索。该框架包含三个核心组件:(1) 集成统一上下文压缩和线性注意力的长视频生成框架;(2) 由双向注意力蒸馏和增强文本嵌入方案驱动的实时流式加速策略;(3) 用于生成世界事件的文本控制方法。我们在补充材料中提供了代码。
引用
@article{arxiv.2512.22096,
title = {Yume-1.5: A Text-Controlled Interactive World Generation Model},
author = {Xiaofeng Mao and Zhen Li and Chuanhao Li and Xiaojie Xu and Kaining Ying and Tong He and Jiangmiao Pang and Yu Qiao and Kaipeng Zhang},
journal= {arXiv preprint arXiv:2512.22096},
year = {2025}
}