基于迭代原型的手语翻译
计算机视觉与模式识别
2023-08-24 v1
摘要
本文提出 IP-SLT,一个简洁而高效的手语翻译 (SLT) 框架。我们的 IP-SLT 采用循环结构,并通过迭代精炼的方式增强输入手语视频的语义表示(原型)。我们的思路模仿人类阅读行为,即一个句子可被反复理解,直至达到准确理解。在技术层面,IP-SLT 由特征提取、原型初始化和迭代原型精炼组成。初始化模块基于特征提取模块提取的视觉特征生成初始原型。随后,迭代精炼模块利用交叉注意力机制,将先前原型与原始视频特征聚合以对其进行打磨。通过反复精炼,原型最终收敛到更稳定且准确的状态,从而产生流畅且恰当的翻译。此外,为利用原型的序列依赖性,我们进一步提出迭代蒸馏损失,将最终迭代的知识压缩至先前迭代中。由于自回归解码过程在推理时仅执行一次,我们的 IP-SLT 能以可接受的开销改进各类 SLT 系统。我们在公开基准上进行了大量实验以证明 IP-SLT 的有效性。
引用
@article{arxiv.2308.12191,
title = {Sign Language Translation with Iterative Prototype},
author = {Huijie Yao and Wengang Zhou and Hao Feng and Hezhen Hu and Hao Zhou and Houqiang Li},
journal= {arXiv preprint arXiv:2308.12191},
year = {2023}
}
备注
Accepted by ICCV 2023