利用适配的图像模型改进连续手语识别
计算机视觉与模式识别
2024-04-15 v1
摘要
网络规模弱标注图文对的大量增加极大地促进了大规模视觉语言模型(如 CLIP)的发展,这些模型在一系列下游任务中展现出了出色的泛化性能。然而,庞大的模型规模和可用数据的稀缺性限制了它们在下游任务中微调整个模型的应用。此外,完全微调模型很容易遗忘在预训练阶段获得的通用基础知识,并对下游数据产生过拟合。为了在将这些大型视觉语言模型(如 CLIP)适配以执行连续手语识别(CSLR)时实现高效率,同时保持其泛化能力,我们提出了一种新策略(AdaptSign)。具体而言,采用 CLIP 作为视觉主干来提取逐帧特征,其参数被固定,并引入一组可学习模块来建模空间手语变化或捕获时间手语动作。引入的额外模块非常轻量,仅增加 3.2% 的额外计算量且具有高效率。在此过程中,预训练阶段获得的通用知识被很好地保留在冻结的 CLIP 主干中。大量实验表明,尽管 AdaptSign 很高效,但在包括 PHOENIX14、PHOENIX14-T、CSL-Daily 和 CSL 在内的一系列 CSLR 基准测试中,其性能优于现有方法。可视化结果表明,AdaptSign 能够学会动态地将主要注意力集中在手语视频中的信息丰富空间区域和跨帧轨迹上。
引用
@article{arxiv.2404.08226,
title = {Improving Continuous Sign Language Recognition with Adapted Image Models},
author = {Lianyu Hu and Tongkai Shi and Liqing Gao and Zekang Liu and Wei Feng},
journal= {arXiv preprint arXiv:2404.08226},
year = {2024}
}