SignSparK:通过稀疏关键帧学习的高效多语言手语生成
计算机视觉与模式识别
2026-03-24 v3
摘要
生成自然且在语言学上准确的手语头像仍是一个巨大的挑战。当前的手语生产(SLP)框架面临一个明显的权衡:直接文本到姿态模型受均值回归效应的制约,而字典检索方法则产生机械、不连贯的转换。为解决这一问题,我们提出了一种新颖的训练范式,利用稀疏关键帧捕捉人类手势的真实底层运动分布。通过从这些离散锚点预测稠密运动,我们的方法缓解了均值回归的同时确保流畅的演示。为实现大规模应用,我们首先引入 FAST,一种超高效的手语分割模型,自动从中精确的时间边界中开采。我们然后 presented SignSparK,一个大规模条件流匹配(CFM)框架,利用这些提取的锚点在 SMPL-X 和 MANO 空间中合成 3D 手势序列。这种关键帧驱动的表述还独特地解锁了关键帧到姿态(KF2P)生成,使得对手势序列的精确时空编辑成为可能。此外,我们采用基于重建的 CFM 目标,使得 SignSparK 能够在少于十个采样步骤内实现高保真合成;这使其能够跨越四种不同的手语,建立目前规模最大的多语言 SLP 框架。最后,通过整合 3D 高斯溶解进行照明感人,广泛评估表明 SignSparK 在多样化的 SLP 任务和多语言基准上建立了新的最高水平。
引用
@article{arxiv.2603.10446,
title = {SignSparK: Efficient Multilingual Sign Language Production via Sparse Keyframe Learning},
author = {Jianhe Low and Alexandre Symeonidis-Herzig and Maksym Ivashechkin and Ozge Mercanoglu Sincan and Richard Bowden},
journal= {arXiv preprint arXiv:2603.10446},
year = {2026}
}