Tamaththul3D: 从单目视频生成高保真 3D 阿拉伯手语模型
计算机视觉与模式识别
2026-05-14 v1 人工智能
摘要
阿拉伯手语 (ArSL) 及其方言服务全球约 4 亿阿拉伯语使用者,然而该社区缺乏高质量的 3D 参数化标注和专门的重建方法用于模型生成。我们通过两个关键贡献填补了这一关键性空白:首先,我们引入了面向 Ishara-500 阿拉伯手语数据集的首个高质量 3D 参数化标注,为 500 个文化上真实的 SSL 手势提供精确的 SMPL-X 参数。其次,我们提出了 Tamaththul3D,一个专为 ArSL 独特关节模式设计的重建管线。我们的管线集成了 SMPLer-X 用于稳健的身体估计,WiLoR 用于详细的手部细化,包括自动局部化和镜像,以及 MediaPipe 用于 2D 姿态监督。通过基于运动学链的手腕对齐与混合摆动-扭转分解以及 2D 监督的关节优化,Tamaththul3D 实现了最先进的手部精度(相较于前方法提升最高 32%),同时保持竞争的身体姿态。这些 3D 标注和 Tamaththul3D 管线共同建立了第一个面向高保真 ArSL 模型重建的全面框架,为阿拉伯听盲社区的无障碍技术和文化保存提供了新的可能性。
引用
@article{arxiv.2605.05367,
title = {Tamaththul3D: High-Fidelity 3D Saudi Sign Language Avatars from Monocular Video},
author = {Eyad Alghamdi and Sattam Altuuaim and Obay Ghulam and Abdulrahman Qutah and Yousef Basoodan},
journal= {arXiv preprint arXiv:2605.05367},
year = {2026}
}