中文

基于 Transformer 的语言-视觉单调一致网络用于手语制作

计算机视觉与模式识别 2024-12-24 v1 多媒体

摘要

手语制作 (SLP) 旨在生成对应于 spoken language 句子的手语视频,其中将 gloss 转换为 pose (G2P) 的转换是关键步骤。由于跨模态语义鸿沟以及缺乏词汇-动作对应标签用于强监督对齐,SLP 在语言-视觉一致性方面面临巨大挑战。本文提出一种基于 Transformer 的语言-视觉单调一致网络 (LVMCN) 用于 SLP,通过 Cross-modal Semantic Aligner (CSA) 和 Multimodal Semantic Comparator (MSC) 约束细粒度跨模态单调对齐和粗粒度多模态语义一致性。在 CSA 中,我们通过计算跨模态特征序列(即手语 gloss 和动作序列)之间的余弦相似度关联矩阵来约束相应 gloss 和 pose 序列之间的隐式对齐。就 MSC 而言,我们基于批量数据中的配对样本和非配对样本构建多模态三元组。通过拉近相应文本-视觉对之间的距离并推远非相应文本-视觉对之间的距离,我们约束相应 gloss 和 pose 序列之间的语义共现程度(即粗粒度文本句子和手语视频之间的语义一致性)。在流行的 PHOENIX14T 基准测试上进行的大量实验表明,LVMCN 在状态-of-the-art 方面取得了优异的性能。

关键词

引用

@article{arxiv.2412.16944,
  title  = {Linguistics-Vision Monotonic Consistent Network for Sign Language Production},
  author = {Xu Wang and Shengeng Tang and Peipei Song and Shuo Wang and Dan Guo and Richang Hong},
  journal= {arXiv preprint arXiv:2412.16944},
  year   = {2024}
}

备注

Accepted by ICASSP 2025