SRNet:通过拆分-重组方法改进三维人体姿态估计的泛化能力
计算机视觉与模式识别
2020-07-21 v1
摘要
训练集中罕见或未见的姿态对网络而言难以预测。类似于视觉识别中的长尾分布问题,此类姿态的少量样本限制了网络对它们建模的能力。有趣的是,局部姿态分布受长尾问题影响较小,即罕见姿态中的局部关节配置可能出现在训练集的其他姿态中,从而使其不那么罕见。我们提议利用这一事实以更好地泛化到罕见和未见的姿态。具体而言,我们的方法将身体拆分为局部区域并在独立的网络分支中处理,利用关节位置主要依赖于其局部身体区域内关节的特性。全局一致性通过将来自身体其余部分的全局上下文作为低维向量重组进每个分支来保持。由于较不相关身体区域的维度降低,网络分支内的训练集分布更贴近局部姿态而非全局身体姿态的统计,且不牺牲对关节推断重要的信息。所提出的拆分-重组方法称为 SRNet,可轻松适配单图像和时序模型,并在罕见与未见姿态的预测中带来可观改进。
引用
@article{arxiv.2007.09389,
title = {SRNet: Improving Generalization in 3D Human Pose Estimation with a Split-and-Recombine Approach},
author = {Ailing Zeng and Xiao Sun and Fuyang Huang and Minhao Liu and Qiang Xu and Stephen Lin},
journal= {arXiv preprint arXiv:2007.09389},
year = {2020}
}
备注
European Conference on Computer Vision (ECCV), 2020