迁移跨域知识用于视频手语识别
计算机视觉与模式识别
2020-03-18 v2 人机交互
多媒体
摘要
词级手语识别(WSLR)是手语翻译中的一项基础任务,要求模型从视频中识别孤立手语词。然而,标注 WSLR 数据需要专家知识,从而限制了 WSLR 数据集的获取。相反,互联网上有大量带字幕的手语新闻视频。由于这些视频没有词级标注且与孤立手语存在较大域差距,无法直接用于训练 WSLR 模型。我们观察到,尽管存在较大域差距,孤立手语与新闻手语共享相同的视觉概念,如手势和身体动作。受此启发,我们提出一种新方法,通过学习域不变视觉概念,并将带字幕新闻手语的知识迁移给 WSLR 模型以滋养之。为此,我们使用基础 WSLR 模型提取新闻手语,然后设计一个在新闻与孤立手语上联合训练的分类器来粗略对齐这两类域特征。为学习每个类内的域不变特征并抑制域特定特征,我们的方法进一步借助外部记忆来存储已对齐新闻手语的类别质心。随后我们基于所学描述子设计时间注意力以提升识别性能。在标准 WSLR 数据集上的实验结果表明,我们的方法显著优于以往最优方法。我们还展示了该方法在自动定位手语新闻中手语的有效性,在 [email protected] 上达到 28.1。
引用
@article{arxiv.2003.03703,
title = {Transferring Cross-domain Knowledge for Video Sign Language Recognition},
author = {Dongxu Li and Xin Yu and Chenchen Xu and Lars Petersson and Hongdong Li},
journal= {arXiv preprint arXiv:2003.03703},
year = {2020}
}
备注
CVPR2020 (oral) preprint