用于手语识别与翻译的多流关键点注意力网络
计算机视觉与模式识别
2024-05-10 v1
摘要
手语作为一种非声音交流方式,通过手势、面部表情和身体动作传递信息和意义。当前大多数手语识别(SLR)和翻译方法依赖于RGB视频输入,这容易受到背景波动的影响。采用基于关键点的策略不仅能减轻背景变化的影响,还能显著降低模型的计算需求。然而,当代基于关键点的方法未能充分利用嵌入在关键点序列中的隐式知识。为应对这一挑战,我们的灵感来源于人类认知机制,该机制通过分析手势配置与补充元素之间的相互作用来辨别手语。我们提出一种多流关键点注意力网络,用于描述由现有关键点估计器生成的关键点序列。为促进多流之间的交互,我们研究了多种方法,如关键点融合策略、头部融合和自蒸馏。由此产生的框架称为MSKA-SLR,通过简单添加额外的翻译网络,可扩展为手语翻译(SLT)模型。我们在Phoenix-2014、Phoenix-2014T和CSL-Daily等知名基准上进行了全面实验,以展示我们方法的有效性。值得注意的是,我们在Phoenix-2014T的手语翻译任务上取得了新的最先进性能。代码和模型可在https://github.com/sutwangyan/MSKA获取。
引用
@article{arxiv.2405.05672,
title = {Multi-Stream Keypoint Attention Network for Sign Language Recognition and Translation},
author = {Mo Guan and Yan Wang and Guangkun Ma and Jiarui Liu and Mingzu Sun},
journal= {arXiv preprint arXiv:2405.05672},
year = {2024}
}
备注
15 pages