中文

T2Bs:通过视频生成实现文本到角色融合变形

图形学 2025-09-30 v2

摘要

我们提出了 T2Bs,一个通过结合静态文本到 3D 生成与视频扩散,从文本生成高质量、可动画化的角色头部可变形模型的框架。文本到 3D 模型能生成精细的静态几何,但缺乏运动合成能力,而视频扩散模型生成的运动存在时间和多视角几何不一致性。T2Bs 通过利用可变形 3D 高斯泼溅将静态 3D 资产与视频输出对齐,从而弥合了这一差距。通过用静态几何约束运动并采用视角依赖的变形 MLP,T2Bs (i) 在准确性和表现力上优于现有的 4D 生成方法,同时减少了视频伪影和视角不一致性,并且 (ii) 重建出平滑、连贯、完全配准的 3D 几何,旨在为构建具有多样、逼真面部运动的可变形模型进行扩展。这使得合成富有表现力、可动画化的角色头部成为可能,超越了当前的 4D 生成技术。

关键词

引用

@article{arxiv.2509.10678,
  title  = {T2Bs: Text-to-Character Blendshapes via Video Generation},
  author = {Jiahao Luo and Chaoyang Wang and Michael Vasilkovsky and Vladislav Shakhrai and Di Liu and Peiye Zhuang and Sergey Tulyakov and Peter Wonka and Hsin-Ying Lee and James Davis and Jian Wang},
  journal= {arXiv preprint arXiv:2509.10678},
  year   = {2025}
}