中文

面向结构保持的文本到手语生成任务的几何感知损失函数

计算机视觉与模式识别 2025-09-30 v1 计算与语言

摘要

从文本到手语的翻译在促进聋人和听障人士的有效沟通中扮演着关键角色。一个主要挑战在于生成准确且自然的身体姿态和动作,以忠实传达意图含义。先前的方法常常忽略人体骨骼运动的解剖学约束和协调模式,导致输出僵硬或生物力学上不合理。为解决此问题,我们提出一种新颖的方法,通过对关节位置、骨骼长度和运动动力学施加几何约束,显式地建模骨骼关节(包括肩部、手臂和手部)之间的关系。在训练过程中,我们引入了一种父关节相对重加权机制,以增强手指灵活性并减少运动僵硬。此外,骨骼姿态损失和骨骼长度约束强制保持解剖学上一致的结构。我们的方法将先前最佳结果与真值之间的性能差距缩小了56.51%,并进一步将骨骼长度和运动方差的差异分别降低了18.76%和5.48%,在解剖学真实感和运动自然度方面取得了显著提升。

关键词

引用

@article{arxiv.2509.23011,
  title  = {Geometry-Aware Losses for Structure-Preserving Text-to-Sign Language Generation},
  author = {Zetian Wu and Tianshuo Zhou and Stefan Lee and Liang Huang},
  journal= {arXiv preprint arXiv:2509.23011},
  year   = {2025}
}