CiCo:基于跨语言对比学习的领域感知手语检索
计算机视觉与模式识别
2023-03-23 v1
摘要
本工作关注手语检索这一近期提出的手语理解任务。手语检索包含两个子任务:文本到手语视频(T2V)检索与手语视频到文本(V2T)检索。与传统视频-文本检索不同,手语视频不仅包含视觉信号,还因手语本身也是自然语言而自带丰富的语义。考虑到这一特性,我们将手语检索表述为一个跨语言检索问题以及一项视频-文本检索任务。具体而言,我们同时考虑手语与自然语言的语言学属性,并在联合嵌入空间中对比文本与手语视频的同时,识别细粒度的跨语言(即手语到词)映射。这一过程被称为跨语言对比学习。另一挑战来自数据稀缺问题——手语数据集的规模比语音识别小数个数量级。我们通过采用在大规模手语视频上预训练的域无关手语编码器,并借助伪标注将其适配到目标域,来缓解该问题。我们的框架称为基于跨语言对比学习的领域感知手语检索(简称 CiCo),在多个数据集上大幅优于开创性方法,例如在 How2Sign 数据集上 T2V 和 V2T 的 R@1 分别提升 +22.4 和 +28.0,在 PHOENIX-2014T 数据集上 T2V 和 V2T 的 R@1 分别提升 +13.7 和 +17.1。代码与模型见:https://github.com/FangyunWei/SLRT。
引用
@article{arxiv.2303.12793,
title = {CiCo: Domain-Aware Sign Language Retrieval via Cross-Lingual Contrastive Learning},
author = {Yiting Cheng and Fangyun Wei and Jianmin Bao and Dong Chen and Wenqiang Zhang},
journal= {arXiv preprint arXiv:2303.12793},
year = {2023}
}
备注
Accepted by CVPR 2023. Code and models are available at: https://github.com/FangyunWei/SLRT