LipSound2:面向唇语到语音重建与唇读的自监督预训练
声音
2022-09-13 v2 人工智能
音频与语音处理
摘要
本工作的目标是研究跨模态自监督预训练对语音重建(视频到音频)的影响,通过利用视频中音频与视觉流的自然共现。我们提出LipSound2,它包含一个编码器-解码器架构和位置感知注意力机制,直接将面部图像序列映射到梅尔尺度频谱图,无需任何人工标注。所提出的LipSound2模型首先在约2400小时的多语言(如英语和德语)音视频数据(VoxCeleb2)上进行预训练。为验证所提方法的泛化性,我们随后在特定领域数据集(GRID、TCD-TIMIT)上对预训练模型进行英语语音重建微调,并在说话人依赖和说话人独立设置下,相比先前方法在语音质量和可懂度上取得了显著提升。除英语外,我们还在CMLR数据集上进行中文语音重建,以验证对可迁移性的影响。最后,我们通过在预训练语音识别系统上微调生成的音频来训练级联唇读(视频到文本)系统,并在英语和中文基准数据集上均达到了最先进的性能。
引用
@article{arxiv.2112.04748,
title = {LipSound2: Self-Supervised Pre-Training for Lip-to-Speech Reconstruction and Lip Reading},
author = {Leyuan Qu and Cornelius Weber and Stefan Wermter},
journal= {arXiv preprint arXiv:2112.04748},
year = {2022}
}
备注
ACCEPTED IN IEEE Transactions on Neural Networks and Learning Systems