用于手语翻译的姿态估计系统评估
摘要
许多手语翻译(SLT)系统在姿态序列而非原始视频上运行,以降低输入维度、提高可移植性并部分匿名化手语者。姿态估计器的选择通常被视为一种实现细节,系统默认使用广泛可用的工具,如 MediaPipe Holistic 或 OpenPose。我们对基于姿态的 SLT 的姿态估计器进行了系统比较,涵盖了广泛使用的基线(MediaPipe Holistic、OpenPose)以及较新的全身/高容量模型(MMPose WholeBody、OpenPifPaf、AlphaPose、SDPose、Sapiens、SMPLest-X)。我们通过在 RWTH-PHOENIX-Weather 2014 上训练一个受控的 SLT 流水线来量化下游影响,其中仅姿态表示发生变化,并使用 BLEU 和 BLEURT 进行评估。为了将翻译结果置于上下文中,我们使用 Signsuisse 数据集中更高分辨率的视频分析了时间稳定性、手部关键点缺失以及对遮挡的鲁棒性。SDPose 和 Sapiens 取得了最佳的翻译性能(BLEU ~11.5),优于常用的 MediaPipe 基线(BLEU ~10)。在遮挡情况下,Sapiens 在所有测试实例中均正确(15/15),而 OpenPifPaf 几乎在所有实例中均失败(1/15),并且翻译得分也最弱。经常遗漏手部关键点的估计器与较低的 BLEU/BLEURT 相关。我们发布的代码不仅可以用于复现我们的实验,还大大降低了其他研究人员使用替代姿态估计器的门槛。
引用
@article{arxiv.2604.24609,
title = {Evaluation of Pose Estimation Systems for Sign Language Translation},
author = {Catherine O'Brien and Gerard Sant and Mathias Müller and Sarah Ebling},
journal= {arXiv preprint arXiv:2604.24609},
year = {2026}
}
备注
Accepted at LREC 2026 Workshop on the Representation and Processing of Sign Languages. O'Brien and Sant contributed equally to this paper. 16 pages, 6 figures