中文

基于复杂环境的中文连续手语数据集

计算机视觉与模式识别 2025-09-11 v2

摘要

当前连续手语识别(CSLR)研究的瓶颈在于,大多数公开可用数据集限制于实验室环境或电视节目录制,导致单一背景环境 Lighting均匀,显著偏离现实场景的多样性和复杂性。为此,我们构建了一个新的大型数据集用于中文连续手语(CSL),称为复杂环境-中文手语数据集(CE-CSL)。该数据集包含5,988个连续CSL视频剪辑,收录自日常场景,包含超过70种不同的复杂背景,以确保代表性和泛化能力。为解决复杂背景对CSLR性能的影响,我们提出了一种时频网络(TFNet)模型用于连续手语识别。该模型提取帧级特征,然后分别利用时序和频谱信息来派生序列特征,以实现高效和准确的CSLR。实验结果表明,我们的方法在CE-CSL上实现了显著的性能提升,验证了在复杂背景条件下的有效性。此外,我们提出的方法也在三个公开可用CSL数据集上取得了高度具竞争的结果。

关键词

引用

@article{arxiv.2409.11960,
  title  = {A Chinese Continuous Sign Language Dataset Based on Complex Environments},
  author = {Qidan Zhu and Jing Li and Fei Yuan and Jiaojiao Fan and Quan Gan},
  journal= {arXiv preprint arXiv:2409.11960},
  year   = {2025}
}

备注

11 pages, 3 figures