中文

基于条件变分自编码器的跨模态对齐手语翻译

计算与语言 2023-12-27 v1

摘要

手语翻译旨在将连续手语视频转换为文本句子。作为典型的多模态任务,手语视频与口语文本之间存在固有的模态差距,因此视觉与文本模态之间的跨模态对齐至关重要。然而,以往研究往往依赖中间的手语标注表示来帮助缓解跨模态问题,从而忽略了对齐跨模态,可能导致结果不佳。为解决此问题,我们提出了一种基于条件变分自编码器的手语翻译框架(CV-SLT),该框架促进手语视频与口语文本之间直接且充分的跨模态对齐。具体而言,我们的CV-SLT包含两条路径,分别使用两个Kullback-Leibler(KL)散度来正则化编码器和解码器的输出。在先验路径中,模型仅依赖视觉信息预测目标文本;而在后验路径中,它同时编码视觉信息和文本知识以重建目标文本。第一个KL散度优化条件变分自编码器并正则化编码器输出,而第二个KL散度执行从后验路径到先验路径的自蒸馏,确保解码器输出的一致性。我们进一步通过采用共享注意力残差高斯分布(ARGD)来增强后验路径中文本信息的整合,该分布将后验路径中的文本信息视为相对于先验路径的残差分量。在公开数据集(PHOENIX14T和CSL-daily)上进行的大量实验证明了我们框架的有效性,实现了新的最先进结果,同时显著缓解了跨模态表示差异。

关键词

引用

@article{arxiv.2312.15645,
  title  = {Conditional Variational Autoencoder for Sign Language Translation with Cross-Modal Alignment},
  author = {Rui Zhao and Liang Zhang and Biao Fu and Cong Hu and Jinsong Su and Yidong Chen},
  journal= {arXiv preprint arXiv:2312.15645},
  year   = {2023}
}

备注

Accepted as conference paper by AAAI24. The code and models are available at https://github.com/rzhao-zhsq/CV-SLT