中文

Deformer:用于鲁棒手姿估计的动态融合Transformer

计算机视觉与模式识别 2023-08-21 v2

摘要

准确估计三维手姿对于理解人类如何与世界交互至关重要。尽管取得了显著进展,现有方法在手部被严重遮挡或模糊时往往难以生成合理的手姿。在视频中,手部的运动使我们能够观察到在单帧中可能被遮挡或模糊的手部各个部分。为自适应地利用遮挡或模糊前后的视觉线索以实现鲁棒手姿估计,我们提出Deformer:一种隐式推理同一图像内(空间维度)与不同时间步(时间维度)手部各部位间关系的框架。我们表明,朴素地应用Transformer自注意力机制并不充分,因为某些帧中的运动模糊或遮挡会导致严重扭曲的手部特征并生成不精确的键与查询。为应对该挑战,我们在Deformer中引入动态融合模块,其预测手的形变并将邻近帧的手部网格预测变形以显式支持当前帧估计。此外,我们观察到误差在不同手部部位间分布不均,指尖附近顶点比手掌附近顶点具有不成比例更高的误差。我们通过引入一种称为maxMSE的新损失函数缓解该问题,其自动调整每个顶点的权重以使模型聚焦于关键手部部位。大量实验表明,我们的方法以10%显著优于最先进方法,且对遮挡更具鲁棒性(超过14%)。

关键词

引用

@article{arxiv.2303.04991,
  title  = {Deformer: Dynamic Fusion Transformer for Robust Hand Pose Estimation},
  author = {Qichen Fu and Xingyu Liu and Ran Xu and Juan Carlos Niebles and Kris M. Kitani},
  journal= {arXiv preprint arXiv:2303.04991},
  year   = {2023}
}

备注

In ICCV 2023. Project: https://fuqichen1998.github.io/Deformer/