AnimateAnyMesh++: 一个灵活的 4D 基础模型,用于高保真文本驱动的网格动画
计算机视觉与模式识别
2026-04-30 v1
摘要
近期的 4D 内容生成技术引发了日益增长的关注,但由于建模时空分布的复杂性以及 4D 训练数据的稀缺,创建高质量动画 3D 模型仍然具有挑战性。我们提出了 AnimateAnyMesh++,这是一套针对任意 3D 网格进行文本驱动动画的前馈框架,在数据、架构和生成能力方面实现了大幅升级。首先,我们通过从 Objaverse-XL 中挖掘动态内容,扩充了 DyMesh-XL 数据集,将唯一身份数从 6 万增加至 30 万,显著拓宽了类别和运动的多样性。其次,我们对 DyMeshVAE-Flex 进行重新设计,采用幂律拓扑感知注意力和顶点法线增强特征,显著改善了轨迹重建、局部几何保持,并缓解了轨迹粘附痕迹。最后,我们对 DyMeshVAE-Flex 和矩形流 (rectified-flow, RF) 生成器进行架构修改,支持可变长度序列的训练与生成,使动画时长得以延长,同时保持重建保真度。大量实验表明,AnimateAnyMesh++ 能在数秒内生成语义准确、时序一致的网格动画,优于先前方法在质量和效率上的表现。扩充后的 DyMesh-XL、升级版的 DyMeshVAE-Flex 以及可变长 RF,均在基准测试和野外网格上取得持续性提升。我们将在本稿接受后发布代码、模型以及扩充后的 DyMesh-XL,以推动 4D 内容创建领域的研究。
引用
@article{arxiv.2604.26917,
title = {AnimateAnyMesh++: A Flexible 4D Foundation Model for High-Fidelity Text-Driven Mesh Animation},
author = {Zijie Wu and Chaohui Yu and Fan Wang and Xiang Bai},
journal= {arXiv preprint arXiv:2604.26917},
year = {2026}
}
备注
14 pages, TPAMI submission, code url: https://github.com/JarrentWu1031/AnimateAnyMesh-pp