4DEquine:从单目视频中 disentangle 运动与外观的4D马的重建
计算机视觉与模式识别
2026-03-12 v1
摘要
从单目视频中进行4D动物重建对于动物福利至关重要。以往的主流4D动物重建方法需要对整个视频同时优化运动和外观,这既耗时又对观察不完整敏感。在本工作中,我们提出了 novel 框架4DEquine,通过将4D重建问题分解为两个子问题:动态运动重建和静态外观重建。对于运动,我们引入一种简单且有效的时空转换器,配合后期优化阶段,从视频中回归平滑且像素对齐的姿态和形状序列。对于外观,我们设计了一种 novel feed-forward网络,从单张图像即可重建高保真、可动画的3D高斯体。为辅助训练,我们创建了大规模合成运动数据集VarenPoser,特点是高质量表面运动和多样化相机轨迹,以及合成外观数据集VarenTex,包含通过多视角扩散生成的真实多视角图像。尽管仅在合成数据集上训练,4DEquine在真实世界的APT36K和AiM数据集上实现了最先进的性能,证明了4DEquine及我们新数据集在几何和外观重建方面的优势。全面的消融研究验证了运动和外观重建网络的有效性。项目页面:https://luoxue-star.github.io/4DEquine_Project_Page/。
引用
@article{arxiv.2603.10125,
title = {4DEquine: Disentangling Motion and Appearance for 4D Equine Reconstruction from Monocular Video},
author = {Jin Lyu and Liang An and Pujin Cheng and Yebin Liu and Xiaoying Tang},
journal= {arXiv preprint arXiv:2603.10125},
year = {2026}
}
备注
Accepted to CVPR2026