中文

用于联合生成 CG 就绪人类与兼容服装的文本到 3D 框架

计算机视觉与模式识别 2026-04-01 v3 图形学

摘要

创建具有匹配服装的详细 3D 人类 avatar 传统上需要专业知识和劳动密集型工作流程。尽管生成式 AI 的最新进展实现了文本到 3D 人类和服装合成,但现有方法在提供可访问的集成流水线以生成可进行物理模拟的 CG-ready 3D avatar 方面仍有所不足;此处我们使用 CG-ready 一词指代遵循计算机图形学(CG)中常见技术美学的模型,并采用标准 CG 多边形网格和发丝表示(而非 NeRF 和 3DGS 等神经表示),可直接集成到传统 CG 流水线中并支持物理模拟等下游任务。为弥合这一差距,我们引入了 Tailor,一个集成的文本到 3D 框架,可生成高保真、可定制的 3D avatar 并穿着仿真就绪服装。Tailor 由三个阶段组成。(1) 语义解析:我们采用大语言模型解释文本描述,并将其转换为参数化人类 avatar 和语义匹配的服装模板。(2) 几何感知服装生成:我们提出拓扑保持变形与新颖几何损失,以在文本控制下生成身体对齐的服装。(3) 一致纹理合成:我们提出一种新颖的多视角扩散过程,优化服装纹理,强制视图一致性,保留照片级真实细节,并可选地支持服装中常见的对称纹理生成。通过全面的定量和定性评估,我们证明 Tailor 在保真度、可用性和多样性方面超越了最先进方法。我们的代码将面向学术用途发布。项目页面:https://human-tailor.github.io

关键词

引用

@article{arxiv.2503.12052,
  title  = {A Text-to-3D Framework for Joint Generation of CG-Ready Humans and Compatible Garments},
  author = {Zhiyao Sun and Yu-Hui Wen and Ho-Jui Fang and Sheng Ye and Matthieu Lin and Tian Lv and Yong-Jin Liu},
  journal= {arXiv preprint arXiv:2503.12052},
  year   = {2026}
}

备注

Project page: https://human-tailor.github.io