SignBind-LLM:用于手语翻译的多阶段模态融合
计算与语言
2025-12-05 v3 计算机视觉与模式识别
摘要
尽管无词汇标注的手语翻译(SLT)取得了进展,但传统的单模态端到端方法在自然手语的两个关键组成部分上始终表现不佳:高速手语字母的精确识别以及来自面部的异步非手部线索的整合。近期将大语言模型(LLM)应用于 SLT 的进展回避了这一挑战,迫使单一网络同时学习这些内容,导致在翻译姓名、地点和技术术语等关键信息时性能不佳。我们引入了 SignBind-LLM,一个旨在克服这些局限性的模块化框架。我们的方法为连续手语、手语字母和唇语阅读采用独立的、专门的预测器。每个专家网络首先将其特定模态解码为 token 序列。然后,这些并行流由一个轻量级 Transformer 融合,在将组合表示传递给大语言模型(LLM)进行最终句子生成之前解决时间不对齐问题。我们的方法在 How2Sign、ChicagoFSWildPlus 和 BOBSL 数据集上确立了新的 SOTA,BLEU-4 分数分别为 22.1、73.2% 的字母准确率和 6.8。这些结果验证了我们的核心假设:在融合之前隔离并解决不同的识别任务,为稳健、高保真的手语翻译提供了一条更强大、更有效的途径。
引用
@article{arxiv.2509.00030,
title = {SignBind-LLM: Multi-Stage Modality Fusion for Sign Language Translation},
author = {Marshall Thomas and Edward Fish and Richard Bowden},
journal= {arXiv preprint arXiv:2509.00030},
year = {2025}
}