用于 RGB-D 图像双手重建的金字塔深度融合网络
计算机视觉与模式识别
2024-04-11 v2
摘要
从单目图像准确恢复双手的稠密三维网格因遮挡与投影歧义而极具挑战。现有多数方法从彩色图像提取特征以估计根对齐的手部网格,忽视了真实世界中关键的深度与尺度信息。鉴于传感器测量噪声大且分辨率有限,基于深度的方法预测三维关键点而非稠密网格。这些局限促使我们利用这两种互补输入以获取真实世界尺度的稠密手部网格。本工作中,我们提出一种端到端框架用于恢复双手稠密网格,其以单视图 RGB-D 图像对作为输入。主要挑战在于有效利用两种不同输入模态以减轻 RGB 图像中的模糊效应与深度图像中的噪声。我们并未将深度图直接作为 RGB 图像的额外通道,而是将深度信息编码为无序点云以保留更多几何细节。具体而言,我们的框架分别采用 ResNet50 与 PointNet++ 从 RGB 与点云提取特征。此外,我们引入一种新颖的金字塔深度融合网络(PDFNet)以聚合不同尺度下的特征,其相较先前融合策略展现出更优效能。进而,我们采用基于 GCN 的解码器处理融合特征并恢复相应的三维姿态与稠密网格。通过充分的消融实验,我们不仅证明了所提融合算法的有效性,且在公开数据集上优于当前最优方法。为复现结果,我们将在 {https://github.com/zijinxuxu/PDFNet} 公开源代码与模型。
引用
@article{arxiv.2307.06038,
title = {Pyramid Deep Fusion Network for Two-Hand Reconstruction from RGB-D Images},
author = {Jinwei Ren and Jianke Zhu},
journal= {arXiv preprint arXiv:2307.06038},
year = {2024}
}
备注
Accepted by TCSVT