SDPose:基于循环引导自蒸馏的 Token 化姿态估计
计算机视觉与模式识别
2024-04-05 v1
摘要
近期,基于 Transformer 的方法在人体姿态估计(HPE)上取得了 SOTA 的预测质量。然而,大多数这些性能优异的基于 Transformer 的模型计算消耗和存储需求过大,难以部署在边缘计算平台上。那些需要较少资源的基于 Transformer 的模型由于其较小的规模而容易欠拟合,因此表现明显不如其较大的同类模型。鉴于这一难题,我们引入了 SDPose,一种用于提升小型基于 Transformer 模型性能的新型自蒸馏方法。为了缓解欠拟合问题,我们设计了一种基于多次循环前向的 Transformer 模块,名为 Multi-Cycled Transformer(MCT),以更充分地挖掘小模型参数的潜力。此外,为了防止 MCT 带来的额外推理计算消耗,我们引入了一种自蒸馏方案,将 MCT 模块中的知识提取到朴素前向模型中。具体而言,在 MSCOCO 验证集上,SDPose-T 以 4.4M 参数和 1.8 GFLOPs 获得了 69.7% mAP。此外,SDPose-S-V2 在 MSCOCO 验证集上以 6.2M 参数和 4.7 GFLOPs 获得了 73.5% mAP,在主流微型神经网络方法中取得了新的 SOTA。我们的代码可在 https://github.com/MartyrPenink/SDPose 获取。
关键词
引用
@article{arxiv.2404.03518,
title = {SDPose: Tokenized Pose Estimation via Circulation-Guide Self-Distillation},
author = {Sichen Chen and Yingyi Zhang and Siming Huang and Ran Yi and Ke Fan and Ruixin Zhang and Peixian Chen and Jun Wang and Shouhong Ding and Lizhuang Ma},
journal= {arXiv preprint arXiv:2404.03518},
year = {2024}
}
备注
Accepted by CVPR 2024