中文

MoZoo:野生动物毛发和肌肉模拟中的视频扩散模型力量

图形学 2026-05-15 v1 计算机视觉与模式识别 机器学习

摘要

电影级动物特效的创建需要精确建模肌肉和毛发动态,这在传统制作工作流程中既费时又Computationally expensive。虽然生成式扩散模型在各种艺术工作流程中显示出前景,但其用于高保真动物模拟的潜力仍基本未被利用。我们提出MoZoo,这是一个生成式动力学求解器,绕过常规细化,直接从粗糙网格生成受多模态引导的高保真动物视频。我们提出Role-Aware RoPE(RAR-RoPE),其采用基于角色的索引重映射以同步运动对齐,同时通过固定时间偏移解耦参考信息。此外,Asymmetric Decoupled Attention将潜在序列划分为非对称解耦注意力,以强制单向信息流,有效防止特征干扰并提高计算效率。为解决高质量训练数据稀缺的问题,我们引入MoZoo-Data,一个利用渲染引擎和逆映射方法构建的大规模配对序列数据集。进一步,我们建立MoZooBench,一个包含120个网格-视频配对的综合性基准。实验结果表明,MoZoo在多样化的动物骨骼和布局下实现了高保真毛发模拟,保持了卓越的时序和结构一致性。

关键词

引用

@article{arxiv.2605.13857,
  title  = {MoZoo:Unleashing Video Diffusion power in animal fur and muscle simulation},
  author = {Dongxia Liu and Jie Ma and Xiaochen Yang and Jiancheng Zhang and Bin Xia and Zhehan Kan and Nisha Huang and Jun Liang and Wenming Yang and Jin Li},
  journal= {arXiv preprint arXiv:2605.13857},
  year   = {2026}
}

备注

Github Page:https://dongxialiu15.github.io/MoZoo/