中文

ViPNAS:通过神经架构搜索实现高效视频姿态估计

计算机视觉与模式识别 2021-05-24 v1

摘要

人体姿态估计近年来取得了显著进展。然而,近期大多数方法侧重于使用复杂模型提升精度,而忽略了实时效率。为了在精度与效率之间实现更好的权衡,我们提出了一种新颖的神经架构搜索(NAS)方法,称为ViPNAS,用于在空间和时间两个层面搜索网络,以实现快速的在线视频姿态估计。在空间层面,我们精心设计了包含网络深度、宽度、核大小、分组数和注意力五个不同维度的搜索空间。在时间层面,我们在一系列时间特征融合中进行搜索,以优化跨多个视频帧的总体精度与速度。据我们所知,我们是首个在视频中搜索时间特征融合与自动计算分配的。大量实验证明了我们的方法在具有挑战性的COCO2017和PoseTrack2018数据集上的有效性。我们发现的模型族S-ViPNAS和T-ViPNAS,在CPU实时推理速度下取得了显著高于以往的state-of-the-art方法的推理速度,且不牺牲精度。

关键词

引用

@article{arxiv.2105.10154,
  title  = {ViPNAS: Efficient Video Pose Estimation via Neural Architecture Search},
  author = {Lumin Xu and Yingda Guan and Sheng Jin and Wentao Liu and Chen Qian and Ping Luo and Wanli Ouyang and Xiaogang Wang},
  journal= {arXiv preprint arXiv:2105.10154},
  year   = {2021}
}

备注

Accepted to CVPR 2021