HeadPosr:基于 Transformer 编码器的端到端可训练头部姿态估计
计算机视觉与模式识别
2022-02-09 v1
摘要
本文提出 HeadPosr,用于从单张 RGB 图像预测头部姿态。HeadPosr 采用了一种包含 transformer 编码器的新型架构。具体而言,它由以下部分组成:(1) 骨干网络;(2) 连接器;(3) transformer 编码器;(4) 预测头。本文研究了在头部姿态估计(HPE)中使用 transformer 编码器的意义。在 HeadPosr 所用 transformer 中,针对以下方面进行了广泛的消融实验:(1) 编码器数量;(2) 头数;(3) 不同位置嵌入;(4) 不同激活函数;(5) 输入通道大小。还展示了关于以下方面的进一步研究:(1) 不同骨干网络,(2) 不同学习率。详尽的实验与消融研究使用了三个不同的、广泛使用的 HPE 开源数据集,即 300W-LP、AFLW2000 和 BIWI 数据集。实验表明,当使用 300W-LP 训练时,HeadPosr 在 AFLW2000 和 BIWI 数据集上优于所有 SOTA 方法,包括无 landmark 的方法以及基于 landmark 或深度估计的其他方法。在对比数据集结果取平均时它也表现更优,从而为 HPE 问题树立了基准,同时也证明了 transformer 相对于 SOTA 方法的有效性。
引用
@article{arxiv.2202.03548,
title = {HeadPosr: End-to-end Trainable Head Pose Estimation using Transformer Encoders},
author = {Naina Dhingra},
journal= {arXiv preprint arXiv:2202.03548},
year = {2022}
}
备注
8 pages, 4 figures