M3T: 离散多模态运动记号用于手语制作
计算机视觉与模式识别
2026-03-26 v1
摘要
手语制作需要超过手势生成。非手势特征,包括 mouthings、眉毛抬起、凝视和头部运动,在语法上是必需的,不能仅从手动关节器官中恢复。现有的3D制作系统面临两个障碍:标准身体模型提供的面部空间维数过低,无法编码这些 articulations;而当采用更丰富的表示时,标准离散记号化会出现码本坍塌,导致表现空间的大部分不可到达。我们提出了 SMPL-FX,它将 FLAME 的丰富表达空间与 SMPL-X 身体耦合,并对 resulting representation 采用针对身体、手和面部的模态特定有限标量量化VAE进行记号化。M3T 是一个在此多模态运动词汇上训练的自回归变换器,并附加一个翻译目标,以鼓励语义导向的嵌入。跨越三个标准基准 (How2Sign、CSL-Daily、Phoenix14T),M3T 实现了手语制作质量的SOTA,而在 NMFs-CSL 上,该模型在非手势特征可区分的情形下,准确率达58.3%,显著高于最强可比姿态基线的49.0%。
引用
@article{arxiv.2603.23617,
title = {M3T: Discrete Multi-Modal Motion Tokens for Sign Language Production},
author = {Alexandre Symeonidis-Herzig and Jianhe Low and Ozge Mercanoglu Sincan and Richard Bowden},
journal= {arXiv preprint arXiv:2603.23617},
year = {2026}
}