面向连续手语识别的视觉对齐约束
计算机视觉与模式识别
2021-08-19 v2 人机交互
摘要
基于视觉的连续手语识别(CSLR)旨在从图像流中识别未分段的手势。过拟合是CSLR训练中最关键的问题之一,已有工作表明迭代训练方案可部分解决该问题,但同时也耗费更多训练时间。在本研究中,我们重新审视近期CSLR工作中的迭代训练方案,并认识到特征提取器的充分训练对解决过拟合问题至关重要。因此,我们提出一种视觉对齐约束(VAC),以通过对齐监督增强特征提取器。具体而言,所提VAC包含两种辅助损失:一种仅关注视觉特征,另一种强制特征提取器与对齐模块之间的预测对齐。此外,我们提出两个指标,通过度量特征提取器与对齐模块之间的预测不一致来反映过拟合。在两个具挑战性的CSLR数据集上的实验结果表明,所提VAC使CSLR网络可端到端训练并取得了有竞争力的性能。
引用
@article{arxiv.2104.02330,
title = {Visual Alignment Constraint for Continuous Sign Language Recognition},
author = {Yuecong Min and Aiming Hao and Xiujuan Chai and Xilin Chen},
journal= {arXiv preprint arXiv:2104.02330},
year = {2021}
}
备注
Accpted to ICCV 2021, code is available at: https://github.com/Blueprintf/VAC_CSLR