中文

X-Streamer:用于构建数字人类智能体的统一人类世界建模框架

计算机视觉与模式识别 2025-09-29 v1

摘要

我们提出X-Streamer,这是一个面向构建能够在文本、语音和视频之间进行无限交互的数字人类智能体的端到端多模态人类世界建模框架。从单个肖像开始,X-Streamer能够实现由流式多模态输入驱动的实时、开放式视频通话。其核心是一种思考者-演员双变压器架构,统一了多模态理解与生成,将静态肖像转化为持久且聪明的音视频交互。思考者模块感知并对流式用户输入进行推理,其隐藏状态被演员模块转化为实时的同步多模态流。具体而言,思考者利用预训练的大型语言-语音模型,而演员则采用分块自回归扩散模型,对思考者的隐藏状态进行交叉注意,从而生成包含交错离散文本和音频标记以及连续视频潜在变量的时间对齐多模态响应。为确保长期稳定性,我们设计了具有时间对齐多模态位置嵌入的 intra- 与 inter-块注意力,以实现细粒度的跨模态对齐和上下文保留,进一步通过分块扩散强制和全局身份参考加强了这一过程。X-Streamer 在两块 A100 GPU 上实时运行,能够在任意肖像上维持数小时的持续视频聊天体验,为数字人类交互式世界建模的统一方法铺平了道路。

关键词

引用

@article{arxiv.2509.21574,
  title  = {X-Streamer: Unified Human World Modeling with Audiovisual Interaction},
  author = {You Xie and Tianpei Gu and Zenan Li and Chenxu Zhang and Guoxian Song and Xiaochen Zhao and Chao Liang and Jianwen Jiang and Hongyi Xu and Linjie Luo},
  journal= {arXiv preprint arXiv:2509.21574},
  year   = {2025}
}

备注

Project Page at https://byteaigc.github.io/X-Streamer