基于块扩散的下一代推理引擎 Inferix:用于世界模拟
计算机视觉与模式识别
2026-04-30 v2 人工智能
摘要
世界模型是智能体 AI、具身 AI 和游戏等领域的核心模拟器,能够生成持久的、物理上真实且交互式的高质量视频。此外,扩大这些模型的规模可能释放感知、理解和推理方面的涌现能力,为超越当前以 LLM 为中心的视觉基础模型的新范式铺平道路。一个关键突破是半自回归(块扩散)解码范式,它通过在每个块内应用扩散生成视频标记,同时对前一个块进行条件,合并扩散和自回归方法的优势,产生更连贯和稳定的视频序列。关键在于,它克服了标准视频扩散的局限性,通过重新引入 LLM 风格的 KV Cache 管理,实现高效、可变长且高质量的生成。因此,Inferix 专为通过优化的半自回归解码过程实现沉浸式世界合成而设计。这种专注于世界模拟的设计不同于为高并发场景(如 vLLM 或 SGLang)或经典视频扩散模型(如 xDiTs)设计的系统。Inferix 进一步通过交互式视频流和分析,实现实时交互和逼真的模拟,以准确建模世界动态。此外,它支持通过无缝集成 LV-Bench 实现高效基准测试,后者是为分钟级视频生成场景量身定制的新型细粒度评估基准。我们希望社区共同推动 Inferix 的发展,促进世界模型的探索。
引用
@article{arxiv.2511.20714,
title = {Inferix: A Block-Diffusion based Next-Generation Inference Engine for World Simulation},
author = {Inferix Team and Tianyu Feng and Yizeng Han and Jiahao He and Yuanyu He and Xi Lin and Teng Liu and Hanfeng Lu and Jiasheng Tang and Wei Wang and Zhiyuan Wang and Jichao Wu and Mingyang Yang and Yinghao Yu and Zeyu Zhang and Bohan Zhuang},
journal= {arXiv preprint arXiv:2511.20714},
year = {2026}
}