基于二维图像集合的文本引导三维人体生成
计算机视觉与模式识别
2023-10-23 v2
摘要
三维人体建模已广泛用于游戏、电影与动画中的交互体验。这类角色的定制化对创造力与可扩展性至关重要,这也凸显了可控性的重要意义。本工作中,我们提出文本引导三维人体生成(\texttt{T3H}),即模型依据服饰描述生成三维人体。其目标有二:1)三维人体应可灵活摆姿渲染;2)其着装由给定文本控制。为应对该 \texttt{T3H} 任务,我们提出组合跨模态人体模型(CCH)。CCH 采用跨模态注意力,将组合式人体渲染与提取的服饰语义相融合。各人体部位感知相关的文本引导作为其视觉图案。我们引入人体先验与语义判别以增强三维几何变换与细粒度一致性,使其能从二维集合中学习以提升数据效率。我们在 DeepFashion 与 SHHQ 上进行了评估,涵盖上装与下装的形状、面料及颜色等多样服饰属性。大量实验表明,CCH 在 \texttt{T3H} 任务上以高效率取得了优越结果。
引用
@article{arxiv.2305.14312,
title = {Text-guided 3D Human Generation from 2D Collections},
author = {Tsu-Jui Fu and Wenhan Xiong and Yixin Nie and Jingyu Liu and Barlas Oğuz and William Yang Wang},
journal= {arXiv preprint arXiv:2305.14312},
year = {2023}
}
备注
EMNLP'23 (Findings) ; Project website: https://text-3dh.github.io/