多模态零样本手语识别
计算机视觉与模式识别
2021-09-06 v1
摘要
零样本学习(ZSL)近年来快速发展。为克服手语识别(SLR)中的标注瓶颈,我们借助文本描述,探索了在无标注视觉样本情况下的零样本手语识别(ZS-SLR)思路。为此,我们提出了一种多模态零样本手语识别(ZS-SLR)模型,利用深度融合特征与基于骨架特征的互补能力。一个基于Transformer的模型与C3D模型分别用于手部检测与深度特征提取。为在基于骨架与深度特征的维度间取得权衡,我们在长短期记忆(LSTM)网络之上使用自动编码器(AE)。最后,利用语义空间将视觉特征映射到类标签的语言嵌入,该嵌入通过来自Transformers的双向编码器表示(BERT)模型获得。在RKS-PERSIANSIGN、First-Person、ASLVID和isoGD四个大规模数据集上的结果表明,所提模型优于ZS-SLR中最先进的替代方法。
引用
@article{arxiv.2109.00796,
title = {Multi-Modal Zero-Shot Sign Language Recognition},
author = {Razieh Rastgoo and Kourosh Kiani and Sergio Escalera and Mohammad Sabokrou},
journal= {arXiv preprint arXiv:2109.00796},
year = {2021}
}
备注
arXiv admin note: text overlap with arXiv:2108.10059