中文

Archon:用于整体数字人生成的统一多模态模型

计算机视觉与模式识别 2026-05-29 v1 人工智能

摘要

数字人是沉浸式交互的基础,但创建用于整体模态(包括文本、音频、动作和视觉内容)的统一模型仍是一个未解决的挑战。本文提出了 Archon,一款全预训练的、以人类为中心的统一多模态模型,用于整体化身生成。Archon 统一了七种模态,配合模态特定的分词器,以及在同步模态和 72 种多样化任务上预训练的原生自回归统一多模态模型,以建模整体联合分布。为解决高保真说话视频中 token 爆炸问题,本文引入了高效的语义视频重参数化,实现 4 倍的 token 降低,同时保持细粒度动态,搭配语义驱动的视频扩散解码器。我们进一步提出了“模态思考”(Thinking in Modality) 方法,通过在另一种模态链中分解模糊的跨模态任务,逐步思考,从而逐步提升保真度和可控性。大量实验表明,Archon 在多种数字人生成任务中表现出优异或相当的性能,验证了我们统一框架的有效性。项目页面:https://zju3dv.github.io/archon/。

关键词

引用

@article{arxiv.2605.30311,
  title  = {Archon: A Unified Multimodal Model for Holistic Digital Human Generation},
  author = {Chong Bao and Shichen Liu and Lijun Yu and David Futschik and Stylianos Moschoglou and Shefali Srivastava and Ziqian Bai and Feitong Tan and Guofeng Zhang and Zhaopeng Cui and Sean Fanello and Yinda Zhang},
  journal= {arXiv preprint arXiv:2605.30311},
  year   = {2026}
}

备注

Accepted to CVPR 2026. Project Page: https://zju3dv.github.io/archon/