用于多人三维姿态估计的置换不变关系网络
计算机视觉与模式识别
2022-06-01 v2
摘要
从单张 RGB 图像恢复多人 3D 姿态是一个严重不适定问题,源于固有的 2D-3D 深度模糊、人与人之间的遮挡以及身体截断。为应对这些问题,近期工作通过同时推理不同人物已展现出可喜结果。然而,多数情况下这仅考虑了成对人物交互,因而阻碍了能够捕捉长程交互的整体场景表征。一些方法通过联合处理场景中所有人物来解决该问题,但它们需要将其中一人定义为参考并预先规定人物顺序,且对此选择敏感。本文克服了上述两方面的局限,提出一种独立于输入顺序捕捉长程交互的多人 3D 姿态估计方法。为此,我们构建了一个类残差的置换不变网络,可成功精炼由现成检测器估计出的可能受损的初始 3D 姿态。该残差函数通过 Set Transformer 模块学习,其对所有初始姿态之间的交互进行建模,而不论其顺序或数量。充分评估表明,我们的方法能以大幅优势提升初始估计的 3D 姿态性能,在标准化基准上取得 SOTA 结果。此外,所提模块计算高效,并可作为即插即用的补充用于多人场景中的任意 3D 姿态检测器。
引用
@article{arxiv.2204.04913,
title = {Permutation-Invariant Relational Network for Multi-person 3D Pose Estimation},
author = {Nicolas Ugrinovic and Adria Ruiz and Antonio Agudo and Alberto Sanfeliu and Francesc Moreno-Noguer},
journal= {arXiv preprint arXiv:2204.04913},
year = {2022}
}