基于空间-时间图 Transformer 的位姿不确定性感知运动同步性估计
计算机视觉与模式识别
2022-08-03 v1 人机交互
摘要
运动同步性反映了交互双方身体动作的协调性。运动同步性的估计已被 Transformer 网络等强大的深度学习模型自动化。然而,以往基于 Transformer 的工作并未针对运动同步性估计设计专用网络,而是广泛采用如人体活动识别等其他任务的架构。因此,本文提出了一种基于骨架的图 Transformer 用于运动同步性估计。所提模型先应用 ST-GCN(一种用于骨架特征提取的空间-时间图卷积神经网络),随后接入用于空间特征生成的空间 Transformer。该空间 Transformer 由独特设计的、在交互个体相同关节间共享的关节位置嵌入引导。此外,我们在时间注意力计算中引入了时间相似性矩阵,以考量身体动作的周期性本质。另外,与每个关节关联的置信度分数反映了位姿的不确定性,而以往运动同步性估计工作未充分重视此点。由于 Transformer 网络训练需大量数据,我们使用人体活动识别基准数据集 Human3.6M 构建了运动同步性估计数据集,并采用对比学习在其上预训练模型。我们进一步应用知识蒸馏,以隐私保护方式缓解位姿检测器失效带来的信息损失。我们在源自自闭症治疗干预的 PT13 数据集上将方法与代表性方法比较。我们的方法取得了 88.98% 的总体准确率,大幅超越同类方法,同时保持数据隐私。
引用
@article{arxiv.2208.01161,
title = {Pose Uncertainty Aware Movement Synchrony Estimation via Spatial-Temporal Graph Transformer},
author = {Jicheng Li and Anjana Bhat and Roghayeh Barmaki},
journal= {arXiv preprint arXiv:2208.01161},
year = {2022}
}
备注
Accepted by 24th ACM International Conference on Multimodal Interaction (ICMI'22). 17 pages, 2 figures