中文

从孤立手语迈向连续手语对话

计算机视觉与模式识别 2026-05-15 v1

摘要

手语是许多聋人和重听人 (DHH) 手语者的主要语言,然而大多数对话式 AI 系统仍通过口语或书面语言中介交互。这种以口语为中心的界面可能会限制那些最易获取媒介并非口语或书面语的手语者的使用,这促使了直接手语到手语对话建模。然而,句子级手语视频数据的采集与标注成本高昂,导致现有手语翻译与生成模型的词汇覆盖有限且开放域泛化能力较弱。我们通过从孤立手语构建连续手语对话来解决这一瓶颈:大规模标注的孤立片段被采集为词汇锚定的运动基元,并重新组合为源自现有对话语料库的手语语序话语。我们引入了 SignaVox-W(据我们所知,它提供了迄今为止最大的标注孤立手语词汇表)和 SignaVox-U(基于 SignaVox-W 构建的连续三维手语对话数据集)。为弥合口语与手语之间的结构失配,我们使用检索引导的口语到 gloss 翻译器;为桥接独立采集的孤立片段,我们提出 BRAID,一种执行时长对齐与协同发音边界修复的扩散 Transformer。利用所得数据,我们训练了 SignaVox,一种直接手语到手语的对话模型,它能在推理时无需口语文本或外部提供的 gloss 的情况下,根据先前的手语上下文生成三维身体、手部和面部运动响应。定量与定性评估表明,该方法改善了从孤立到连续的运动质量,增强了响应级别的语义对齐,并提供了可扩展的以手语者为中心的交互,从而更好地支持视觉空间表达。

关键词

引用

@article{arxiv.2605.14705,
  title  = {Towards Continuous Sign Language Conversation from Isolated Signs},
  author = {Youngmin Kim and Kyobin Choo and Jiwoo Park and Minseo Kim and Chanyoung Kim and Junhyeok Kim and Seong Jae Hwang},
  journal= {arXiv preprint arXiv:2605.14705},
  year   = {2026}
}