EVA01:通过混合 Transformer 实现统一的本质 3D 理解与生成
计算机视觉与模式识别
2026-05-19 v1
摘要
本文聚焦于将 3D 网格作为多模态大语言模型(MLLM)的本质模态进行集成的挑战。基于扩散的大规模重建模型解耦了语义理解与几何推理,作为以稠密 2D 像素先验为条件的无状态重构器工作。最近的 MLLM 方法将 3D 模态视为外部输出而非多模态序列的本质组成部分,未对几何流形与 MLLM 特征空间的对齐进行系统性分析。我们引入 EVA01,一个统一框架,扩展了 MLLM 的模态边界,使其能够本质性地集成 3D 网格的理解、生成与上下文感知编辑。基于混合 Transformer(MoT)架构,EVA01 将模型解耦为预训练的理解专家()和结构镜像化的生成专家(),通过硬模态路由的共享全局自注意力进行耦合。该设计将 MLLM 背板的语义潜在空间与几何流形对齐,实现无需中间 2D 表示的多模态先验直接迁移。结果表明,EVA01 实现了本质文本到 3D 生成的领先性能, unlocked robust long-context multi-turn geometric editing with identity preservation—a capability fundamentally inaccessible to stateless reconstruction pipelines. 我们进一步提供了将 2D 基础模型与 3D 任务集成的架构见解,为设计 3D 本质多模态系统指明了方向。项目页面:https://www.seeles.ai/research/pages/EVA01
引用
@article{arxiv.2605.16745,
title = {EVA01: Unified Native 3D Understanding and Generation via Mixture-of-Transformers},
author = {Zongyuan Yang and Mingjing Yi and Wanli Ma and Chenzhuo Fan and Bocheng Li and Baolin Liu and Yuke Lou and Yingde Song and Yongping Xiong and Zhengdong Guo and Shimu Wang},
journal= {arXiv preprint arXiv:2605.16745},
year = {2026}
}
备注
28 pages, 10 figures, 6 tables. Technical report