面向手势语言运动生成的音系引导方法:基于扩散模型的基线与条件分析
计算机视觉与模式识别
2026-03-31 v2
摘要
生成自然、正确且视觉顺畅的3D头像手势语言运动,基于文本输入进行条件化,仍然极具挑战性。本文训练了一个3D身体运动生成模型,探讨了音系属性条件化在手势语言运动生成中的作用,采用ASL-LEX 2.0注释,如手部姿态、手部位置和运动。我们首先使用Human Motion MDM风格的扩散模型建立强大的基线,采用SMPL-X表示,该模型在gloss discriminability指标上超越SignAvatar(一种最先进的CVAE方法)。随后,我们系统性地研究了不同文本编码器(CLIP vs. T5)、条件化模式(gloss-only vs. gloss+音系属性)以及属性notation格式(symbolic vs. 自然语言)在文本条件化中的作用。我们的分析表明,将符号ASL-LEX notation 翻译为自然语言是有效性CLIPTextEncoder条件化的必要条件,而T5则基本不受此翻译影响。此外,我们最佳变体(CLIP配合映射后的属性)在所有指标上均超越SignAvatar。这些发现突显了文本编码器条件化中输入表示的关键作用,并激发了手 gloss 和音系属性通过独立路径编码的结构化条件化方法的动力。
引用
@article{arxiv.2603.17388,
title = {Toward Phonology-Guided Sign Language Motion Generation: A Diffusion Baseline and Conditioning Analysis},
author = {Rui Hong and Jana Kosecka},
journal= {arXiv preprint arXiv:2603.17388},
year = {2026}
}
备注
8 pages, 4 figures