探索注意力机制在多模态信息融合中于手语识别与翻译的应用
计算机视觉与模式识别
2024-10-08 v4 计算与语言
机器学习
摘要
理解身体部位复杂且快速的运动对于手语识别与翻译至关重要。近期,引入用于识别和定位运动身体部位的额外信息成为一个有趣的研究课题。然而,以往利用多模态信息的工作存在诸如次优的多模态特征融合方法,或模型本身计算量过重等问题。在我们的工作中,我们解决了这些问题,并使用基于交叉注意力(cross-attention)的插件模块,以另一种模态恰当地关注每一模态。此外,我们采用两阶段训练,在以端到端方式中去除对额外模态独立特征提取器的依赖,从而减轻对计算复杂度的担忧。另外,我们额外的交叉注意力插件模块非常轻量,不会在原始基线之上增加显著的计算开销。我们在 RWTH-PHOENIX-2014 数据集上评估了手语识别方法,在 RWTH-PHOENIX-2014T 数据集上评估了手语翻译任务。我们的方法在识别任务上降低了 0.9 的 WER,在翻译任务上提升了 0.8 的 BLEU-4 分数。
引用
@article{arxiv.2309.01860,
title = {Exploring Attention Mechanisms in Integration of Multi-Modal Information for Sign Language Recognition and Translation},
author = {Zaber Ibn Abdul Hakim and Rasman Mubtasim Swargo and Muhammad Abdullah Adnan},
journal= {arXiv preprint arXiv:2309.01860},
year = {2024}
}