面向连续手语识别的多尺度局部时序相似性融合
计算机视觉与模式识别
2021-07-28 v1
摘要
连续手语识别(cSLR)是一项将手语视频转写为有序词序列的重要公共任务。由于手语视频帧与对应词之间不存在显式对齐,捕获细粒度的词级细节十分重要。在以往工作中,一种有前景的方法是采用一维卷积网络(1D-CNN)对时序帧进行时序融合。然而,CNN 对相似或不相似不敏感,因而无法捕获时序相邻帧内的局部一致语义。为解决该问题,我们提出通过时序相似性自适应地融合局部特征。具体而言,我们设计了多尺度局部时序相似性融合网络(mLTSF-Net)如下:1)对于特定视频帧,我们首先以多尺度感受野选取其相似邻帧,以适应不同长度的词。2)为保证时序一致性,我们随后使用位置感知卷积对每个尺度的所选帧进行时域卷积。3)为获得局部时序增强的逐帧表示,我们最终使用内容相关的聚合器融合不同尺度的结果。我们以端到端方式训练模型,在 RWTH-PHOENIX-Weather 2014 数据集(RWTH)上的实验结果表明,与若干 SOTA 模型相比,我们的模型取得了具有竞争力的性能。
引用
@article{arxiv.2107.12762,
title = {Multi-Scale Local-Temporal Similarity Fusion for Continuous Sign Language Recognition},
author = {Pan Xie and Zhi Cui and Yao Du and Mengyi Zhao and Jianwei Cui and Bin Wang and Xiaohui Hu},
journal= {arXiv preprint arXiv:2107.12762},
year = {2021}
}