Sigma:面向骨架基签名语言理解的语义信息预训练
计算机视觉与模式识别
2026-04-01 v3 计算与语言
摘要
预训练已被证明对学习签名语言理解(SLU)任务中的可迁移特征有效。最近,基于骨架的方法因其能够在不受外观或环境因素影响的情况下稳健处理主体和背景的变化而受到日益关注。当前的SLU方法仍面临三个关键局限:1)弱语义对齐,因为模型通常捕获骨架数据中的低层次运动模式,但难以将其与语言意义关联;2)局部细节与全局上下文之间的不平衡,模型要么过于专注于细粒度线索,要么忽略它们以捕获更广阔的上下文;3)跨模态学习效率低,因为构建语义对齐的跨模态表征仍然困难。为此,我们提出Sigma,一个统一的骨架基SLU框架,包含:1)面向视觉和文本模态的签名感知早期融合机制,促进深度互动,丰富视觉特征以融入语言上下文;2)分层对齐学习策略,联合最大化来自不同模态的不同层级配对特征之间的一致性,有效捕获细粒度细节和高层次语义关系;3)统一的预训练框架,结合对比学习、文本匹配和语言建模,以促进语义一致性和泛化。Sigma在多个覆盖不同签名语言和口语语言的基准上实现了孤立签名识别、连续签名识别和无术语签名翻译的新型状态,表明语义信息丰富的预训练具有重要影响,骨架数据作为SLU的独立解决方案也有效。
引用
@article{arxiv.2509.21223,
title = {Sigma: Semantically Informative Pre-training for Skeleton-based Sign Language Understanding},
author = {Muxin Pu and Mei Kuan Lim and Chun Yong Chong and Chen Change Loy},
journal= {arXiv preprint arXiv:2509.21223},
year = {2026}
}