面向手语识别的人体部位级三维运动上下文学习
计算机视觉与模式识别
2023-08-21 v1
摘要
本文提出P3D,一种用于手语识别的人体部位级运动上下文学习框架。我们的主要贡献体现在两个维度:学习部位级运动上下文,以及采用姿态集成联合利用2D与3D姿态。首先,我们的经验观察表明部位级上下文编码有益于手语识别性能。先前手语识别方法从整体姿态序列中学习运动上下文,我们认为此类方法无法挖掘部位特定运动上下文。为利用部位级运动上下文,我们提出部位编码Transformer(PET)与全身编码Transformer(WET)的交替组合。PET从部位序列编码运动上下文,而WET将其合并为统一上下文。通过学习部位级运动上下文,我们的P3D在WLASL上取得优于先前最先进方法的性能。其次,我们的框架首次集成2D与3D姿态用于手语识别。由于3D姿态蕴含丰富运动上下文与深度信息以区分词语,我们的P3D优于采用姿态集成的先前最先进方法。
引用
@article{arxiv.2308.09305,
title = {Human Part-wise 3D Motion Context Learning for Sign Language Recognition},
author = {Taeryung Lee and Yeonguk Oh and Kyoung Mu Lee},
journal= {arXiv preprint arXiv:2308.09305},
year = {2023}
}
备注
ICCV 2023