中文

BIGS:基于 3D 高斯溶解的单目视频双手类别无关交互重建

计算机视觉与模式识别 2025-04-15 v1

摘要

从单目 RGB 视频重建手-物体交互(HOI)的 3D 结构是一项基础性问题,具有众多应用前景。尽管近期进展取得显著成果,但尚无针对单目视频中双手与未知物体交互的双手类别无关交互重建的综合性方法。以往工作仅解决局限于手-物体交互的情况,其中物体模板已知或仅涉及单只手的交互。双手交互重建因两手与物体之间复杂交互而遭受严重遮挡。为解决此问题,我们首次引入BIGS(Bimanual Interaction 3D 高斯溶解),构建一种从单目视频中重建手与未知物体 3D 高斯的 methods。为稳健获取避免严重遮挡的物体高斯,我们利用预训练扩散模型的先验知识,结合得分蒸馏采样(SDS)损失,以重建未见物体的局部部分。对于手部高斯,我们利用手部模型(即 MANO)的 3D 先验,并为两只手共享单个高斯,以在视角有限的情况下有效累积手部 3D 信息。为进一步考虑手部与物体之间的 3D 对齐,我们在高斯优化过程中包含交互主体优化步骤。我们的方法在两个具有挑战性的数据集上实现了最先进的精度,分别以 3D 手姿态估计(MPJPE)、3D 物体重建(CDh、CDo、F10)和渲染质量(PSNR、SSIM、LPIPS)为指标。

关键词

引用

@article{arxiv.2504.09097,
  title  = {BIGS: Bimanual Category-agnostic Interaction Reconstruction from Monocular Videos via 3D Gaussian Splatting},
  author = {Jeongwan On and Kyeonghwan Gwak and Gunyoung Kang and Junuk Cha and Soohyun Hwang and Hyein Hwang and Seungryul Baek},
  journal= {arXiv preprint arXiv:2504.09097},
  year   = {2025}
}

备注

Accepted to CVPR 2025