中文

由粗到精的动物姿态与形状估计

计算机视觉与模式识别 2021-11-17 v1 机器学习

摘要

大多数现有的动物姿态与形状估计方法利用参数化 SMAL 模型重建动物网格。这是因为 SMAL 模型的低维姿态与形状参数使深度网络更易学习高维动物网格。然而,SMAL 模型是从具有有限姿态与形状变化的玩具动物扫描中学习得到的,因此可能无法很好地表示高度变化的真实动物。这可能导致估计网格与二维证据(如二维关键点或轮廓)拟合不佳。为缓解此问题,我们提出一种从单张图像重建三维动物网格的由粗到精方法。粗估计阶段首先估计 SMAL 模型的姿态、形状与平移参数。随后估计的网格被图卷积网络(GCN)用作起点,在精化阶段预测逐顶点形变。这种基于 SMAL 与基于顶点的表示的组合受益于参数化与非参数化表示二者。我们将网格精化 GCN(MRGCN)设计为具有分层特征表示的编码器-解码器结构,以克服传统 GCN 感受野有限的问题。此外,我们观察到现有动物网格重建工作所使用的全局图像特征无法捕捉用于网格精化的详细形状信息。因此我们引入局部特征提取器以获取顶点级特征,并将其与全局特征一同作为 MRGCN 的输入。我们在 StanfordExtra 数据集上测试了我们的方法并取得了最先进结果。此外,我们在 Animal Pose 与 BADJA 数据集上测试了我们方法的泛化能力。我们的代码可在项目网站上获取。

关键词

引用

@article{arxiv.2111.08176,
  title  = {Coarse-to-fine Animal Pose and Shape Estimation},
  author = {Chen Li and Gim Hee Lee},
  journal= {arXiv preprint arXiv:2111.08176},
  year   = {2021}
}

备注

Accepted by Neurips2021