中文

基于CLIP的参数高效适配的连续手语识别

数论 2025-04-03 v1

摘要

连续手语识别(CSLR)旨在解释和转录视频中的手语手势序列。本文提出CLIP手语适配(CLIP-SLA)框架,利用CLIP模型中预训练的强大视觉编码器通过参数高效微调(PEFT)实现手语任务。我们引入两种变体:SLA-Adapter和SLA-LoRA,将PEFT模块集成到CLIP视觉编码器中,实现仅使用最小可训练参数进行微调。在四个数据集上验证了所提方法的有效性:Phoenix2014、Phoenix2014-T、CSL-Daily和Isharah-500,其中两种CLIP-SLA变体均在更少的可训练参数下超过了多个SOTA模型。广泛的消融研究强调了所提方法在不同视觉语言模型上进行CSLR的有效性和灵活性。这些发现展示了大规模预训练模型适用于可扩展且高效CSLR的潜力,为未来的手语理解技术发展铺平了道路。

关键词

引用

@article{arxiv.2504.01665,
  title  = {On products of sets of natural density one},
  author = {Sandro Bettin and Matteo Bordignon and Alessandro Fazzari},
  journal= {arXiv preprint arXiv:2504.01665},
  year   = {2025}
}

备注

12 pages, 1 figure