中文

面向手势序列的自适应变换器架构——ADAT 用于手语翻译

人工智能 2025-04-17 v1 计算与语言 计算机视觉与模式识别

摘要

当前的手语机器翻译系统依赖于识别手部动作、面部表情和身体姿态,并结合自然语言处理,将手语转换为文本。近期方法使用变换器架构通过位置编码建模长程依赖,但缺乏对捕获于高帧率下手势之间细粒度短程时间依赖的准确性。此外,这些方法的高计算复杂度导致训练效率低下。为缓解此问题,我们提出一种自适应变换器(ADAT),其包含增强特征提取和自适应特征加权通过门控机制以强调上下文相关特征的组件,从而在保持翻译准确率的同时降低训练开销。为评估 ADAT,我们引入 MedASL,即首个公开的医学美国手语数据集。在手语-词-文本实验中,ADAT 在 PHOENIX14T 上的 BLEU-4 准确率提升 0.1%,训练时间缩短 14.33%;在 MedASL 上提升 3.24%。在手语-文本实验中,ADAT 在 PHOENIX14T 上准确率提升 8.7%,训练时间缩短 2.8%;在 MedASL 上准确率提升 4.7%,训练速度提升 7.17%。与基于编码器或解码器的基线方法相比,ADAT 在手语-文本任务中准确率至少高出 6.8%,尽管由于双流结构而略慢 12.1%。

关键词

引用

@article{arxiv.2504.11942,
  title  = {ADAT: Time-Series-Aware Adaptive Transformer Architecture for Sign Language Translation},
  author = {Nada Shahin and Leila Ismail},
  journal= {arXiv preprint arXiv:2504.11942},
  year   = {2025}
}