中文

基于流式Conformer-Transformer与重采样钩子的以人为中心的可编辑语音到手语生成

人机交互 2025-06-25 v2 人工智能

摘要

现有的端到端手语动画系统存在自然度低、面部/身体表现力有限以及缺乏用户控制等问题。我们提出了一种以人为中心的实时语音到手语动画框架,集成了(1)用于同步上肢和面部运动生成的流式Conformer编码器与自回归Transformer-MDN解码器,(2)一种透明的可编辑JSON中间表示,赋予聋人和专家检查和修改每个手语片段的能力,以及(3)一个基于用户编辑和评分优化模型的人机交互优化循环。在Unity3D上部署后,我们的系统实现了平均13毫秒的帧推理时间和103毫秒的端到端延迟。我们的关键贡献包括设计用于细粒度手语个性化的JSON中心编辑机制,以及首次应用基于MDN的反馈循环进行连续模型适应。这种组合建立了一种可泛化的、可解释AI的范式,用于用户自适应、低延迟的多模态系统。在与20名聋人手语者和5名专业翻译人员的测试中,我们观察到相比基线方法SUS评分提升13分,认知负荷降低6.7分,以及自然度和信任度的显著提升(p < .001)。本工作建立了一种可扩展的、可解释AI的范式,用于无障碍手语技术。

关键词

引用

@article{arxiv.2506.14677,
  title  = {Human-Centered Editable Speech-to-Sign-Language Generation via Streaming Conformer-Transformer and Resampling Hook},
  author = {Yingchao Li},
  journal= {arXiv preprint arXiv:2506.14677},
  year   = {2025}
}