通过学习与融合通用语音知识与语种特定知识实现低资源语言唇读
计算机视觉与模式识别
2024-01-15 v2 计算与语言
声音
音频与语音处理
图像与视频处理
摘要
本文提出一种新颖的唇读框架,尤其面向低资源语言,此前文献未充分解决该问题。由于低资源语言缺乏足够的视频-文本配对数据来训练模型以获得充分建模唇部运动与语言的能力,开发低资源语言唇读模型颇具挑战。为缓解该挑战,我们尝试通过语音单元预测,从高资源语言学习通用语音知识(即建模唇部运动的能力)。已知不同语言部分共享常见音素,因此从一种语言学得的通用语音知识可泛化至其他语言。随后,我们提出语种特定记忆增强解码器(LMDecoder)来学习语种特定知识(即建模语言的能力)。LMDecoder 将语种特定音频特征存入记忆库,并可在比视频-文本配对数据更易获取的音频-文本配对数据上训练。因此,借助 LMDecoder,我们可将输入的语音单元转换为语种特定音频特征,并利用所学丰富语言知识将其译为文本。最终,通过结合通用语音知识与语种特定知识,我们即便对低资源语言也能高效开发唇读模型。在使用英语、西班牙语、法语、意大利语和葡萄牙语五种语言的充分实验中,所提方法的有效性得到验证。
引用
@article{arxiv.2308.09311,
title = {Lip Reading for Low-resource Languages by Learning and Combining General Speech Knowledge and Language-specific Knowledge},
author = {Minsu Kim and Jeong Hun Yeo and Jeongsoo Choi and Yong Man Ro},
journal= {arXiv preprint arXiv:2308.09311},
year = {2024}
}
备注
Accepted at ICCV 2023