中文

大语言模型辅助的分解学习用于无注释手语翻译

计算与语言 2024-03-20 v1

摘要

以往的手语翻译(SLT)方法依赖注释标注取得了优越的性能。然而,标注高质量的注释是一项劳动密集型任务,限制了SLT的进一步发展。尽管一些方法通过联合训练视觉编码器和翻译网络来实现无注释SLT,但这些努力仍面临性能不佳和未能有效利用强大的大语言模型(LLM)的问题。最严重的是,我们发现直接将LLM引入SLT会导致视觉表示学习不足,因为LLM主导了学习曲线。为解决这些问题,我们提出了大语言模型辅助的分解学习(FLa-LLM)用于无注释SLT。具体而言,我们将训练过程分解为两个阶段。在视觉初始化阶段,我们在视觉编码器之后使用一个轻量级翻译模型来预训练视觉编码器。在LLM微调阶段,我们冻结视觉编码器中已获得的知识,并将其与预训练的LLM集成,以激发LLM的翻译潜力。这种分解训练策略被证明非常有效,在三个均于无注释设置下进行的SLT数据集上取得了显著的改进。

关键词

引用

@article{arxiv.2403.12556,
  title  = {Factorized Learning Assisted with Large Language Model for Gloss-free Sign Language Translation},
  author = {Zhigang Chen and Benjia Zhou and Jun Li and Jun Wan and Zhen Lei and Ning Jiang and Quan Lu and Guoqing Zhao},
  journal= {arXiv preprint arXiv:2403.12556},
  year   = {2024}
}

备注

Accepted by LREC-COLING-2024