Signs as Tokens:基于检索增强的多语言手语生成器
计算机视觉与模式识别
2025-07-30 v3 计算与语言
摘要
手语是一种视觉语言,涵盖了自然语言中的所有语言特征,是聋人和听力受损者的主要交流方式。尽管已有许多研究成功地将预训练语言模型(LM)应用于手语翻译(手语转文本),但反向任务——手语生成(文本转手语)——仍 largely 未被探索。本文我们提出了一种多语言手语模型 Signs as Tokens(SOKE),该模型能够从文本输入自动生成 3D 手语化身。我们采用预训练语言模型,并利用解耦式分词器将连续的手语离散化为表示 various body parts 的 token 序列。在解码过程中,与现有方法不同,这些方法会将所有部位 token 展平为单个序列并逐个预测单个 token,而我们提出了一种多头解码方法,能够同时预测多个 token。这种方法在保持有效信息融合 across different body parts 的同时,提高了推理效率。为进一步简化生成过程,我们提出了一种检索增强的手语生成方法,该方法整合外部手语词典,提供准确的 word-level 手语作为辅助条件,从而显著提高生成手语的精度。广泛的定性和定量评估表明,SOKE 的效果良好。
引用
@article{arxiv.2411.17799,
title = {Signs as Tokens: A Retrieval-Enhanced Multilingual Sign Language Generator},
author = {Ronglai Zuo and Rolandos Alexandros Potamias and Evangelos Ververas and Jiankang Deng and Stefanos Zafeiriou},
journal= {arXiv preprint arXiv:2411.17799},
year = {2025}
}
备注
Accepted by ICCV 2025