中文

MoDA:从随意视频建模可变形三维物体

计算机视觉与模式识别 2024-06-21 v3

摘要

本文关注从随意视频中建模可变形三维物体的挑战。随着神经辐射场(NeRF)的流行,许多工作将其扩展到动态场景,采用规范 NeRF 与变形模型实现观测空间与规范空间之间的三维点变换。近期工作依赖线性混合蒙皮(LBS)实现规范-观测变换。然而,刚性变换矩阵的线性加权组合并不能保证为刚性。事实上,常出现非预期的缩放与剪切因子。实践中,使用 LBS 作为变形模型常导致弯曲或扭转运动中的皮肤塌陷伪影。为解决该问题,我们提出神经对偶四元数混合蒙皮(NeuDBS)实现三维点变形,其可在无皮肤塌陷伪影下执行刚性变换。为在不同帧间配准二维像素,我们通过求解最优传输问题,建立编码规范空间内三维点的规范特征嵌入与二维图像特征之间的对应。此外,我们引入一种用于纹理渲染的纹理滤波方法,有效最小化目标可变形物体外噪声颜色的影响。在真实与合成数据集上的大量实验表明,我们的方法在定性与定量性能上均优于最先进的方法,可重建人与动物的三维模型。项目页面:\url{https://chaoyuesong.github.io/MoDA}。

关键词

引用

@article{arxiv.2304.08279,
  title  = {MoDA: Modeling Deformable 3D Objects from Casual Videos},
  author = {Chaoyue Song and Jiacheng Wei and Tianyi Chen and Yiwen Chen and Chuan Sheng Foo and Fayao Liu and Guosheng Lin},
  journal= {arXiv preprint arXiv:2304.08279},
  year   = {2024}
}