u-HuBERT:统一混合模态语音预训练及对未标注模态的零样本迁移
计算与语言
2022-11-29 v2 人工智能
计算机视觉与模式识别
声音
音频与语音处理
图像与视频处理
摘要
尽管音视觉语音模型相比纯音频模型可取得更优的性能与鲁棒性,但其开发与采用受限于缺乏标注与未标注的音视觉数据,以及为每种模态部署一个模型的成本。本文提出 u-HuBERT,一种自监督预训练框架,可利用多模态与单模态语音,并采用统一的掩码聚类预测目标。通过在预训练中利用模态丢弃,我们证明单个微调模型可达到与最先进的模态特定模型相当或更优的性能。此外,我们仅用音频微调的模型能很好地处理音视觉与视觉语音输入,在多个语音处理任务上实现零样本模态泛化。特别地,我们的单一模型在 LRS3 上以音视觉/音频/视觉输入分别取得 1.2%/1.4%/27.2% 的语音识别词错误率。代码与模型见 https://github.com/facebookresearch/av_hubert
引用
@article{arxiv.2207.07036,
title = {u-HuBERT: Unified Mixed-Modal Speech Pretraining And Zero-Shot Transfer to Unlabeled Modality},
author = {Wei-Ning Hsu and Bowen Shi},
journal= {arXiv preprint arXiv:2207.07036},
year = {2022}
}
备注
NeurIPS 2022