中文

Hunyuan3D-Omni:用于可控 3D 资产生成的统一框架

计算机视觉与模式识别 2025-09-26 v1 人工智能

摘要

近期的 3D 原生生成模型进展加速了游戏、电影和设计领域的资产创建。然而大多数方法仍主要依赖图像或文本条件,缺乏细粒度的跨模态控制,限制了可控性和实际应用。为填补这一差距,我们提出了 Hunyuan3D-Omni,这是一个基于 Hunyuan3D 2.1 构建的用于细粒度、可控 3D 资产生成的统一框架。除了图像,Hunyuan3D-Omni 还接受点云、体素、包围盒和骨骼姿态先验作为条件信号,使能够对几何、拓扑和姿态进行精确控制。与分别为每个模态设计多个头不同,我们的模型在单个跨模态架构中统一所有信号。我们采用渐进式、难度感知的采样策略,该策略为每个样本选择一种控制模态,并倾向于选择更难的信号(例如骨骼姿态),同时降低更容易的信号(例如点云)的权重,以鼓励稳健的多模态融合和对缺失输入的优雅处理。实验表明,这些额外的控制手段提高了生成精度,使能够实现几何感知的变换,并增加了生产工作流程的鲁棒性。

关键词

引用

@article{arxiv.2509.21245,
  title  = {Hunyuan3D-Omni: A Unified Framework for Controllable Generation of 3D Assets},
  author = {Team Hunyuan3D and : and Bowen Zhang and Chunchao Guo and Haolin Liu and Hongyu Yan and Huiwen Shi and Jingwei Huang and Junlin Yu and Kunhong Li and Linus and Penghao Wang and Qingxiang Lin and Sicong Liu and Xianghui Yang and Yixuan Tang and Yunfei Zhao and Zeqiang Lai and Zhihao Liang and Zibo Zhao},
  journal= {arXiv preprint arXiv:2509.21245},
  year   = {2025}
}

备注

Technical Report; 3D Generation