中文

SEDS:语义增强双流编码器用于手语检索

计算机视觉与模式识别 2024-07-24 v1

摘要

与传统视频检索不同,手语检索更倾向于理解视频剪辑中包含的人类动作语义信息。以往的工作通常仅对RGB视频进行编码以获取高层次语义特征,导致局部动作细节在大量视觉信息冗余中被淹没。此外,现有的基于RGB的手语检索工作受制于密集视觉数据嵌入在端到端训练中的巨大内存成本,采用离线RGB编码器,导致特征表示次优。为解决这些问题,我们提出一种新颖的手语表示框架,称为语义增强双流编码器(Semantically Enhanced Dual-Stream Encoder, SEDS),该框架将Pose和RGB两种模态整合以表示手语视频的局部和全局信息。具体而言,Pose编码器嵌入对应人类关节坐标的关键点,从而有效捕获详细的动作特征。为实现两种视频模态更具上下文感知的融合,我们提出了跨 gloss 注意力融合(Cross Gloss Attention Fusion, CGAF)模块,以聚合来自内模态和跨模态之间具有相似语义信息的相邻剪辑特征。此外,开发了一种姿态-RGB细粒度匹配目标,以通过双流特征的上下文匹配来增强聚合的融合特征。除了离线RGB编码器外,该框架仅包含可学习的轻量级网络,可端到端训练。广泛的实验表明,我们的框架在各种数据集上显著优于最先进的方法。

关键词

引用

@article{arxiv.2407.16394,
  title  = {SEDS: Semantically Enhanced Dual-Stream Encoder for Sign Language Retrieval},
  author = {Longtao Jiang and Min Wang and Zecheng Li and Yao Fang and Wengang Zhou and Houqiang Li},
  journal= {arXiv preprint arXiv:2407.16394},
  year   = {2024}
}

备注

Accepted to ACM International Conference on Multimedia (MM) 2024