用于连续手语识别的去噪对比对齐方法
计算机视觉与模式识别
2024-12-03 v5
摘要
连续手语识别(CSLR)旨在将未裁剪的手语视频中的手势识别为文本 gloss。CSLR 的一个关键挑战是实现视频与 gloss 序列之间有效的跨模态对齐,以增强视频表征。然而,当前的跨模态对齐范式往往忽视文本语法在引导视频表征学习全局时间上下文中的作用,这对识别性能产生了不利影响。为应对这一局限,我们提出了一种去噪对比对齐(DCA)范式。DCA 创造性地利用文本语法通过两种互补途径增强视频表征:从判别角度建模手势与 gloss 之间的实例对应关系,以及从生成角度对齐其全局上下文。具体而言,DCA 使用对比损失实现手势与 gloss 之间灵活的实例级对应。在此基础上,DCA 以视频表征为引导,通过对 gloss 表征去噪来建模视频与 gloss 序列间的全局上下文对齐。此外,DCA 引入梯度调制以优化对齐与识别梯度,确保更有效的学习过程。通过整合 gloss 级与全局上下文知识,DCA 显著增强了 CSLR 任务的视频表征。在公开基准上的实验结果验证了 DCA 的有效性并确认了其视频表征增强的可行性。
引用
@article{arxiv.2305.03614,
title = {Denoising-Contrastive Alignment for Continuous Sign Language Recognition},
author = {Leming Guo and Wanli Xue and Shengyong Chen},
journal= {arXiv preprint arXiv:2305.03614},
year = {2024}
}
备注
11 pages