中文

AggPose:用于婴儿姿态估计的深度聚合视觉Transformer

计算机视觉与模式识别 2022-12-27 v2 人工智能

摘要

新生儿的运动与姿态评估可让有经验的儿科医生预测神经发育障碍,从而对相关疾病进行早期干预。然而,绝大多数最新的人工智能人体姿态估计方法聚焦于成人,缺乏用于婴儿姿态估计的公开基准。本文通过提出婴儿姿态数据集以及用于人体姿态估计的深度聚合视觉Transformer来填补这一空白,其引入了一种快速训练的全Transformer框架,在早期阶段不使用卷积操作提取特征。它将Transformer + MLP推广到特征图内的高分辨率深层聚合,从而实现不同视觉层级间的信息融合。我们在COCO姿态数据集上预训练AggPose,并将其应用于我们新发布的大规模婴儿姿态估计数据集。结果表明,AggPose能有效学习不同分辨率下的多尺度特征,并显著提升婴儿姿态估计性能。我们显示AggPose在婴儿姿态估计数据集上优于混合模型HRFormer与TokenPose。此外,在COCO val姿态估计上,我们的AggPose平均以0.8 AP优于HRFormer。我们的代码见github.com/SZAR-LAB/AggPose。

关键词

引用

@article{arxiv.2205.05277,
  title  = {AggPose: Deep Aggregation Vision Transformer for Infant Pose Estimation},
  author = {Xu Cao and Xiaoye Li and Liya Ma and Yi Huang and Xuan Feng and Zening Chen and Hongwu Zeng and Jianguo Cao},
  journal= {arXiv preprint arXiv:2205.05277},
  year   = {2022}
}

备注

In Proceedings of the Thirty-First International Joint Conference on Artificial Intelligence (IJCAI-22) Special Track on AI for Good