中文

当视觉语音遇见语言:用于高效且上下文感知的视觉语音处理的VSP-LLM框架

计算机视觉与模式识别 2024-05-15 v2 计算与语言 音频与语音处理 图像与视频处理

摘要

在视觉语音处理中,由于唇部运动的模糊性,上下文建模能力是最重要的需求之一。例如,同形异义词(homophenes)——具有相同唇部运动但产生不同声音的单词——可以通过考虑上下文来区分。本文提出了一种新颖的框架,即结合大语言模型(LLM)的视觉语音处理(VSP-LLM),通过引入LLM的强大能力来最大化上下文建模能力。具体而言,VSP-LLM被设计为执行视觉语音识别和翻译的多任务,其中给定的指令控制任务类型。输入视频通过使用自监督视觉语音模型映射到LLM的输入潜在空间。针对输入帧中存在冗余信息这一事实,我们提出了一种新颖的去重方法,通过使用视觉语音单元来减少嵌入的视觉特征。通过所提出的去重方法和低秩自适应(LoRA),VSP-LLM可以以计算高效的方式进行训练。在翻译数据集MuAViC基准上,我们证明仅用30小时标注数据训练的VSP-LLM比用433小时数据训练的近期模型能更有效地翻译唇部运动。

关键词

引用

@article{arxiv.2402.15151,
  title  = {Where Visual Speech Meets Language: VSP-LLM Framework for Efficient and Context-Aware Visual Speech Processing},
  author = {Jeong Hun Yeo and Seunghee Han and Minsu Kim and Yong Man Ro},
  journal= {arXiv preprint arXiv:2402.15151},
  year   = {2024}
}

备注

An Erratum was added on the last page of this paper