中文

Animus3D: 基于运动分数蒸馏的文本驱动 3D 动画

计算机视觉与模式识别 2025-12-16 v1 图形学 机器学习

摘要

我们提出了 Animus3D,一个文本驱动的 3D 动画框架,可根据静态 3D 资产和文本提示生成运动场。此前的方法大多利用 vanilla Score Distillation Sampling (SDS) 目标从预训练的文本到视频扩散模型中蒸馏运动,导致动画运动量极小或出现明显抖动。为解决此问题,我们的方法引入了一种新颖的 SDS 替代方案——运动分数蒸馏 (Motion Score Distillation, MSD)。具体而言,我们引入了一个 LoRA 增强的视频扩散模型,该模型定义了一个静态源分布,而非 SDS 中的纯噪声;同时,另一种基于反演的噪声估计技术在引导运动时确保外观保持。为进一步提高运动保真度,我们引入了显式的时间和空间正则化项,以减轻时间和空间上的几何失真。此外,我们提出了一种运动细化模块,用于提升时间分辨率并增强细粒度细节,从而克服底层视频模型的固定分辨率约束。大量实验表明,Animus3D 能够成功地从多样化的文本提示中动画化静态 3D 资产,生成比最先进基线显著更丰富、更精细的运动,同时保持高视觉完整性。代码将发布于 https://qiisun.github.io/animus3d_page。

关键词

引用

@article{arxiv.2512.12534,
  title  = {Animus3D: Text-driven 3D Animation via Motion Score Distillation},
  author = {Qi Sun and Can Wang and Jiaxiang Shang and Wensen Feng and Jing Liao},
  journal= {arXiv preprint arXiv:2512.12534},
  year   = {2025}
}

备注

SIGGRAPH Asia 2025