SimulSLT:端到端同声手语翻译
计算机视觉与模式识别
2021-12-09 v1
摘要
手语翻译作为一种具有深远社会意义的技术,近年来吸引了越来越多研究者的兴趣。然而,现有的手语翻译方法需要在开始翻译前读取所有视频,这导致推理延迟高,也限制了其在现实场景中的应用。为解决此问题,我们提出了SimulSLT,这是首个端到端同声手语翻译模型,能够将手语视频并发地翻译成目标文本。SimulSLT由一个文本解码器、一个边界预测器和一个掩码编码器组成。我们1)使用wait-k策略进行同声翻译。2)设计了一个基于integrate-and-fire模块的新型边界预测器来输出手语词汇边界,用于建模手语视频与手语词汇之间的对应关系。3)提出了一种创新的重编码方法,帮助模型获取更丰富的上下文信息,使现有的视频特征能够充分交互。在RWTH-PHOENIX-Weather 2014T数据集上的实验结果表明,SimulSLT在保持低延迟的同时,其BLEU分数超过了最新的端到端非同步手语翻译模型,这证明了我们方法的有效性。
引用
@article{arxiv.2112.04228,
title = {SimulSLT: End-to-End Simultaneous Sign Language Translation},
author = {Aoxiong Yin and Zhou Zhao and Jinglin Liu and Weike Jin and Meng Zhang and Xingshan Zeng and Xiaofei He},
journal= {arXiv preprint arXiv:2112.04228},
year = {2021}
}
备注
Accepted by ACM Multimedia 2021