当视觉语音遇见语言:用于高效且上下文感知的视觉语音处理的VSP-LLM框架
计算机视觉与模式识别
2024-05-15 v2 计算与语言
音频与语音处理
图像与视频处理
摘要
在视觉语音处理中,由于唇部运动的模糊性,上下文建模能力是最重要的需求之一。例如,同形异义词(homophenes)——具有相同唇部运动但产生不同声音的单词——可以通过考虑上下文来区分。本文提出了一种新颖的框架,即结合大语言模型(LLM)的视觉语音处理(VSP-LLM),通过引入LLM的强大能力来最大化上下文建模能力。具体而言,VSP-LLM被设计为执行视觉语音识别和翻译的多任务,其中给定的指令控制任务类型。输入视频通过使用自监督视觉语音模型映射到LLM的输入潜在空间。针对输入帧中存在冗余信息这一事实,我们提出了一种新颖的去重方法,通过使用视觉语音单元来减少嵌入的视觉特征。通过所提出的去重方法和低秩自适应(LoRA),VSP-LLM可以以计算高效的方式进行训练。在翻译数据集MuAViC基准上,我们证明仅用30小时标注数据训练的VSP-LLM比用433小时数据训练的近期模型能更有效地翻译唇部运动。
引用
@article{arxiv.2402.15151,
title = {Where Visual Speech Meets Language: VSP-LLM Framework for Efficient and Context-Aware Visual Speech Processing},
author = {Jeong Hun Yeo and Seunghee Han and Minsu Kim and Yong Man Ro},
journal= {arXiv preprint arXiv:2402.15151},
year = {2024}
}
备注
An Erratum was added on the last page of this paper