中文

用于手势语言任务的图网络

计算机视觉与模式识别 2025-05-20 v2

摘要

近期的手势语言研究受益于基于卷积神经网络(CNN)的骨干网络,这些网络主要从传统计算机视觉任务(例如目标识别、图像识别)迁移。然而,这些CNN-based骨干网络通常擅长提取轮廓和纹理等特征,但可能在捕获与手势相关的特征方面存在困难。事实上,手势语言任务需要关注手势相关区域,包括不同区域之间的协作(例如左手区域和右手区域)以及单个区域中的有效内容。为了捕获此类区域相关特征,我们引入了MixSignGraph,将手势序列表示为一组混合图,并设计了以下三个图模块用于特征提取,即局部手势图(LSG)模块、时间手势图(TSG)模块和层次手势图(HSG)模块。具体来说,LSG模块学习单个帧中跨区域特征的相关性,即关注空间特征。TSG模块跟踪相邻帧之间跨区域特征的相互作用,即关注时间特征。HSG模块聚合来自单个帧不同层次特征图中相同区域的特征,即关注层次特征。此外,为了在没有词汇注释的情况下进一步提高手势语言任务的性能,我们提出了一种简单而反直觉的文本驱动CTC预训练(TCP)方法,该方法从文本标签生成伪词汇标签用于模型预训练。在当前五个公开手势语言数据集上的大量实验表明,所提模型在多个手势语言任务上表现优异,尤其在没有任何额外线索的情况下即可超越SOTA模型。

关键词

引用

@article{arxiv.2504.12020,
  title  = {Graph Network for Sign Language Tasks},
  author = {Shiwei Gan and Yafeng Yin and Zhiwei Jiang and Hongkai Wen and Lei Xie and Sanglu Lu},
  journal= {arXiv preprint arXiv:2504.12020},
  year   = {2025}
}

备注

17 pages, 9 figures, submitted to IEEE Transactions on Pattern Analysis and Machine Intelligence (T-PAMI). This is a regular paper submission