SignAligner:协调互补姿态模态以实现连贯的手语生成
计算机视觉与模式识别
2025-06-16 v1
摘要
手语生成旨在基于口语产生多样化的手语表征。然而,由于手语的复杂性——涵盖精细的手部手势、面部表情和身体运动——实现真实自然的生成仍然是一个重大挑战。在本工作中,我们引入 PHOENIX14T+,这是广泛使用的 RWTH-PHOENIX-Weather 2014T 数据集的扩展版本,包含三种新的手语表征:Pose、Hamer 和 Smplerx。我们还提出了一种新的方法 SignAligner,用于真实手语生成,包含三个阶段:文本驱动的姿态模态协同生成、多模态在线协同校正,以及真实手语视频合成。首先,通过融入文本语义,我们设计了一个联合手语生成器,同时生成姿态坐标、手势动作和身体运动。基于 Transformer 架构的文本编码器提取语义特征,而跨模态注意力机制整合这些特征以生成多样化的手语表征,确保精确映射并控制模态特征的多样性。其次,引入在线协同校正,利用动态损失加权策略和跨模态注意力来精炼生成的姿态模态,促进模态间的信息互补,消除时空冲突,确保语义连贯性和动作一致性。最后,校正后的姿态模态被输入预训练的视频生成网络,以生成高保真度的手语视频。大量实验表明,SignAligner 显著提升了生成手语视频的准确性和表现力。
引用
@article{arxiv.2506.11621,
title = {SignAligner: Harmonizing Complementary Pose Modalities for Coherent Sign Language Generation},
author = {Xu Wang and Shengeng Tang and Lechao Cheng and Feng Li and Shuo Wang and Richang Hong},
journal= {arXiv preprint arXiv:2506.11621},
year = {2025}
}