中文

SignAligner:协调互补姿态模态以实现连贯的手语生成

计算机视觉与模式识别 2025-06-16 v1

摘要

手语生成旨在基于口语产生多样化的手语表征。然而,由于手语的复杂性——涵盖精细的手部手势、面部表情和身体运动——实现真实自然的生成仍然是一个重大挑战。在本工作中,我们引入 PHOENIX14T+,这是广泛使用的 RWTH-PHOENIX-Weather 2014T 数据集的扩展版本,包含三种新的手语表征:Pose、Hamer 和 Smplerx。我们还提出了一种新的方法 SignAligner,用于真实手语生成,包含三个阶段:文本驱动的姿态模态协同生成、多模态在线协同校正,以及真实手语视频合成。首先,通过融入文本语义,我们设计了一个联合手语生成器,同时生成姿态坐标、手势动作和身体运动。基于 Transformer 架构的文本编码器提取语义特征,而跨模态注意力机制整合这些特征以生成多样化的手语表征,确保精确映射并控制模态特征的多样性。其次,引入在线协同校正,利用动态损失加权策略和跨模态注意力来精炼生成的姿态模态,促进模态间的信息互补,消除时空冲突,确保语义连贯性和动作一致性。最后,校正后的姿态模态被输入预训练的视频生成网络,以生成高保真度的手语视频。大量实验表明,SignAligner 显著提升了生成手语视频的准确性和表现力。

关键词

引用

@article{arxiv.2506.11621,
  title  = {SignAligner: Harmonizing Complementary Pose Modalities for Coherent Sign Language Generation},
  author = {Xu Wang and Shengeng Tang and Lechao Cheng and Feng Li and Shuo Wang and Richang Hong},
  journal= {arXiv preprint arXiv:2506.11621},
  year   = {2025}
}