中文

基于时空掩码 Transformer 从模糊压力记录中估计人体姿态

计算机视觉与模式识别 2024-07-11 v1 机器学习

摘要

尽管基于视觉的姿态估计器性能令人印象深刻,但它们在恶劣视觉条件下通常表现不佳,且往往无法满足客户的隐私需求。因此,研究者已开始将触觉传感系统作为替代方案。然而,这些系统受困于含噪且模糊的记录。为解决该问题,我们提出了一种从模糊压力数据进行姿态估计的新方案。我们的方法包含一个具有编码器-解码器架构的时空视觉 Transformer。在两个流行的公开数据集上的详细实验表明,我们的模型在该领域优于现有方案。此外,我们观察到在网络早期阶段增加时间裁剪(temporal crops)数量对性能有正向影响,而使用掩码自编码器方法在自监督设定下预训练网络也进一步提升了结果。

关键词

引用

@article{arxiv.2303.05691,
  title  = {Human Pose Estimation from Ambiguous Pressure Recordings with Spatio-temporal Masked Transformers},
  author = {Vandad Davoodnia and Ali Etemad},
  journal= {arXiv preprint arXiv:2303.05691},
  year   = {2024}
}