通过最大化特征融合与高层空间注意力实现高效人体姿态估计
计算机视觉与模式识别
2021-07-30 v1
摘要
本文提出一种高效人体姿态估计网络——SFM(纤细融合模型),通过融合多层次特征并添加轻量注意力模块——HSA(高层空间注意力,High-Level Spatial Attention)。现有许多高效网络方法已考虑特征融合,大幅提升了性能。然而,由于网络中融合操作有限,其性能远不及ResNet和HRNet等大型网络。具体而言,我们在两个金字塔框架间搭建桥梁以扩展融合操作数量,且不增加层数。同时,为捕获长程依赖,我们提出轻量注意力模块——HSA,其计算二阶注意力图。总之,SFM在有限层数内最大化特征融合次数。HSA通过计算空间注意力图的注意力学习高精度空间信息。借助SFM与HSA,我们的网络能以极少计算资源生成多层次特征并提取精确的全局空间信息。因此,我们的方法以更少的参数量和计算代价取得可比甚至更优的精度。我们的SFM在MPII验证集上取得[email protected]为89.0、[email protected]为42.0,在COCO验证集上取得AP为71.7、[email protected]为90.7,仅用1.7G FLOPs和1.5M参数。源代码将很快公开。
引用
@article{arxiv.2107.13693,
title = {Efficient Human Pose Estimation by Maximizing Fusion and High-Level Spatial Attention},
author = {Zhiyuan Ren and Yaohai Zhou and Yizhe Chen and Ruisong Zhou and Yayu Gao},
journal= {arXiv preprint arXiv:2107.13693},
year = {2021}
}