STAR: 基于骨架感知文本的4D虚拟人生成与网络内运动重定向
计算机视觉与模式识别
2024-06-10 v1 图形学
多媒体
摘要
从文本描述创建4D虚拟人(即动画3D虚拟人)通常使用文本到图像(T2I)扩散模型在规范空间中合成3D虚拟人,然后应用目标运动进行动画化。然而,这种“先优化后动画”的范式有几个缺点。(1) 对于姿态无关的优化,在规范姿态下渲染的图像用于朴素得分蒸馏采样(SDS)存在域差距,且仅使用T2I先验无法保持视图一致性;(2) 对于事后动画,简单地将源运动应用于目标3D虚拟人会产生平移伪影和对齐错误。为了解决这些问题,我们提出了基于骨架感知文本的4D虚拟人生成与网络内运动重定向(STAR)。STAR考虑了模板网格和目标虚拟人之间的几何和骨架差异,并通过利用预训练的运动重定向技术来纠正不匹配的源运动。借助信息重定向和遮挡感知的骨架,我们采用了骨架条件T2I和文本到视频(T2V)先验,并提出了一个混合SDS模块,以连贯地提供多视图和帧一致的监督信号。因此,STAR可以端到端地逐步优化几何、纹理和运动。定量和定性实验表明,我们提出的STAR可以合成高质量的4D虚拟人,具有与文本描述良好对齐的生动动画。额外的消融研究显示了STAR中每个组件的贡献。源代码和演示可在\href{https://star-avatar.github.io}{https://star-avatar.github.io}获取。
引用
@article{arxiv.2406.04629,
title = {STAR: Skeleton-aware Text-based 4D Avatar Generation with In-Network Motion Retargeting},
author = {Zenghao Chai and Chen Tang and Yongkang Wong and Mohan Kankanhalli},
journal= {arXiv preprint arXiv:2406.04629},
year = {2024}
}
备注
Tech report