通过掩码多模态聚类预测学习视听语音表征
音频与语音处理
2022-03-15 v2 计算机视觉与模式识别
声音
摘要
语音的视频记录包含相关的音频与视觉信息,为从说话者唇部运动和所产生的声音中进行语音表征学习提供了强信号。我们提出 Audio-Visual Hidden Unit BERT(AV-HuBERT),一种用于视听语音的自监督表征学习框架,其掩码多流视频输入并预测自动发现且迭代精炼的多模态隐单元。AV-HuBERT 学习到强大的视听语音表征,有益于唇读与自动语音识别。在最大的公开唇读基准 LRS3(433 小时)上,AV-HuBERT 仅使用 30 小时标注数据即取得 32.5% 的 WER,优于先前最优方法(33.6%),后者使用多一千倍的转写视频数据(31K 小时)训练。当使用 LRS3 全部 433 小时标注数据并结合自训练时,唇读 WER 进一步降至 26.9%。在同一基准上将我们的视听表征用于纯音频语音识别,相较最优性能取得 40% 的相对 WER 降低(1.3% 对比 2.3%)。我们的代码与模型见于 https://github.com/facebookresearch/av_hubert
引用
@article{arxiv.2201.02184,
title = {Learning Audio-Visual Speech Representation by Masked Multimodal Cluster Prediction},
author = {Bowen Shi and Wei-Ning Hsu and Kushal Lakhotia and Abdelrahman Mohamed},
journal= {arXiv preprint arXiv:2201.02184},
year = {2022}
}
备注
ICLR 2022