中文

FEA-SLT:基于面部表情的无词汇端到端手语翻译框架

计算机视觉与模式识别 2026-05-28 v2 计算与语言

摘要

手语翻译(SLT)是一项需要联合建模手部动作和非手部动作的跨模态任务。现有的无词汇(gloss-free)SLT方法能够有效捕获手势动态,但往往 underutilize(充分利用)面部表情,而面部表情在手语中起着关键的语法和消歧作用。这种限制可能导致当不同概念共享相似的手部配置时出现语义退化。在本文中,我们提出了 FEA-SLT(**F**acial-**E**xpression-**A**ware **S**ign **L**anguage **T**ranslation),即一个无词汇端到端框架,将面部动态用作语义锚点,以解决手部动作的消歧问题。FEA-SLT 采用域迁移面部编码器提取表情敏感的表示,并通过受语言约束的*面部-表情感知融合*(FEAF)模块将其与手部特征集成。FEAF 通过双向调制捕获手部和面部通道之间的相互依赖,增强语法忠实度。在 PHOENIX14T 和 CSL-Daily 数据集上进行实验表明,FEA-SLT 在无词汇方法中实现了 SOTA 的 BLEU 分数,而且有针对性的分析也确认了对面部敏感话语的翻译效果得到改善。代码已公开于 [https://github.com/TuGuobin/FEA-SLT](https://github.com/TuGuobin/FEA-SLT)。

关键词

引用

@article{arxiv.2601.03549,
  title  = {FEA-SLT: A Gloss-Free End-to-End Framework for Facial-Expression-Aware Sign Language Translation},
  author = {Guobin Tu and Di Weng},
  journal= {arXiv preprint arXiv:2601.03549},
  year   = {2026}
}