基于Transformer的端到端可训练多实例姿态估计
计算机视觉与模式识别
2021-12-22 v2
摘要
我们提出一种端到端可训练的多实例姿态估计方法,称为POET(POse Estimation Transformer,姿态估计Transformer)。我们将卷积神经网络与Transformer编码器-解码器架构相结合,将图像中的多实例姿态估计表述为一个直接的集合预测问题。我们的模型能够利用二分匹配方案直接回归所有个体的姿态。POET使用一种新颖的基于集合的全局损失进行训练,该损失由关键点损失、可见性损失和类别损失组成。POET推理多个被检测个体与完整图像上下文之间的关系,以并行方式直接预测其姿态。我们表明POET在COCO关键点检测任务上取得了高精度,同时比其他自底向上和自顶向下方法具有更少的参数和更高的推理速度。此外,我们展示了将POET应用于动物姿态估计时的成功迁移学习。据我们所知,该模型是首个端到端可训练的多实例姿态估计方法,我们希望它能作为一个简单且有前景的替代方案。
引用
@article{arxiv.2103.12115,
title = {End-to-End Trainable Multi-Instance Pose Estimation with Transformers},
author = {Lucas Stoffl and Maxime Vidal and Alexander Mathis},
journal= {arXiv preprint arXiv:2103.12115},
year = {2021}
}