中文

CorrNet+:通过时空相关进行手语识别与翻译

计算机视觉与模式识别 2024-04-18 v1

摘要

在手语中,人体轨迹的传达主要依赖于连续帧中手部和面部表情的协调运动。尽管手语理解方法最近取得了进展,但它们通常只关注单个帧,不可避免地忽略了对于有效建模人体轨迹至关重要的帧间相关性。为了解决这一局限性,本文引入了一个时空相关网络,记为CorrNet+,它显式地跨多个帧识别身体轨迹。具体来说,CorrNet+使用相关模块和识别模块来构建人体轨迹。然后,使用时间注意力模块自适应地评估不同帧的贡献。得到的特征提供了人体运动的整体视角,促进了对手语的更深入理解。作为一个统一模型,CorrNet+在两个广泛的手语理解任务(连续手语识别(CSLR)和手语翻译(SLT))上取得了新的最先进性能。特别是,CorrNet+超越了先前使用资源密集型的姿态估计网络或预提取的热图进行手部和面部特征提取的方法。与CorrNet相比,CorrNet+在所有基准测试中实现了显著的性能提升,同时计算开销减半。与之前的时空推理方法的全面比较验证了CorrNet+的优越性。代码可在https://github.com/hulianyuyy/CorrNet_Plus获取。

关键词

引用

@article{arxiv.2404.11111,
  title  = {CorrNet+: Sign Language Recognition and Translation via Spatial-Temporal Correlation},
  author = {Lianyu Hu and Wei Feng and Liqing Gao and Zekang Liu and Liang Wan},
  journal= {arXiv preprint arXiv:2404.11111},
  year   = {2024}
}

备注

arXiv admin note: substantial text overlap with arXiv:2303.03202