面向低资源手语识别的鲁棒手语嵌入提取
计算机视觉与模式识别
2023-08-17 v2 计算与语言
摘要
孤立手语识别(SLR)大多应用于由有限数量手语者缓慢且清晰打出的手势所构成的数据集。然而,在真实场景中,我们面临具有挑战性的视觉条件、协同发音式打手语、小规模数据集,以及对打手语者无关模型的需求。为解决这一难题,我们需要一个鲁棒的特征提取器来处理手语视频。人们可能认为人体姿态估计器是理想候选。但由于其与训练集之间存在领域偏差以及手语中挑战性姿态,它们在手语数据上缺乏鲁棒性,且基于图像的模型常仍优于基于关键点的模型。此外,尽管使用基于图像的模型进行迁移学习的常见做法能带来更高准确率,基于关键点的模型通常在每个 SLR 数据集上从头训练。这些因素限制了它们对 SLR 的实用性。现有文献也不清楚哪种(若有)姿态估计器对 SLR 效果最佳。我们比较了三种最流行的 SLR 姿态估计器:OpenPose、MMPose 和 MediaPipe。我们表明,通过关键点归一化、缺失关键点填补以及学习姿态嵌入,我们可以获得显著更好的结果并实现迁移学习。我们表明基于关键点的嵌入包含跨语言特征:它们可在手语间迁移,且即使在目标手语上仅微调 SLR 模型的分类器层也能取得有竞争力的性能。我们进一步使用微调后的迁移嵌入取得了优于仅在目标手语上训练模型的性能。这些嵌入也可以多语言方式学习。这类嵌入的应用未来可能对低资源手语尤为有用。
引用
@article{arxiv.2306.17558,
title = {Towards the extraction of robust sign embeddings for low resource sign language recognition},
author = {Mathieu De Coster and Ellen Rushe and Ruth Holmes and Anthony Ventresque and Joni Dambre},
journal= {arXiv preprint arXiv:2306.17558},
year = {2023}
}