用于手语识别与翻译的双流网络
计算机视觉与模式识别
2023-03-24 v2
摘要
手语是使用手部动作和非手动要素来传递信息的视觉语言。对于手语识别与翻译,现有多数方法直接将 RGB 视频编码为隐藏表示。然而,RGB 视频是带有大量视觉冗余的原始信号,导致编码器忽略手语理解的关键信息。为缓解该问题并更好地融入领域知识(如手形和身体运动),我们引入了一个双视觉编码器,包含两条独立流,分别对原始视频和由现成关键点估计器生成的关键点序列进行建模。为使两条流相互交互,我们探索了多种技术,包括双向横向连接、带辅助监督的手语金字塔网络以及帧级自蒸馏。所得模型称为 TwoStream-SLR,可胜任手语识别(SLR)。通过简单附加一个额外的翻译网络,TwoStream-SLR 被扩展为手语翻译(SLT)模型 TwoStream-SLT。在实验上,我们的 TwoStream-SLR 和 TwoStream-SLT 在包括 Phoenix-2014、Phoenix-2014T 和 CSL-Daily 在内的一系列数据集上的 SLR 和 SLT 任务中取得了最先进的性能。代码和模型见:https://github.com/FangyunWei/SLRT。
引用
@article{arxiv.2211.01367,
title = {Two-Stream Network for Sign Language Recognition and Translation},
author = {Yutong Chen and Ronglai Zuo and Fangyun Wei and Yu Wu and Shujie Liu and Brian Mak},
journal= {arXiv preprint arXiv:2211.01367},
year = {2023}
}
备注
Accepted by NeurIPS 2022. Code and models are available at: https://github.com/FangyunWei/SLRT