从原始数据联合学习视觉与听觉语音表示
机器学习
2023-04-06 v2 计算机视觉与模式识别
声音
摘要
我们提出 RAVEn,一种自监督多模态方法,用于联合学习视觉与听觉语音表示。我们的预训练目标包括对掩码输入进行编码,然后预测由缓慢演化的动量编码器生成的上下文目标。受视频与音频固有差异的驱动,我们的设计在两个模态的代理任务上是不对称的:听觉流预测视觉与听觉目标,而视觉流仅预测听觉目标。我们观察到,在对单次预训练阶段得到的视觉与听觉编码器(其中编码器被联合训练)进行微调时,在低资源与高资源标注数据设置下均取得强劲结果。值得注意的是,RAVEn 在 LRS3 的视觉语音识别(VSR)上超越了所有自监督方法,并且将 RAVEn 与仅使用 30 小时标注数据的自训练相结合,甚至优于近期在 90,000 小时非公开数据上训练的半监督方法。同时,我们在 LRS3 低资源设置下实现了听觉语音识别(以及 VSR)的最先进结果。我们的发现表明,完全从原始视频和音频中学习强大的语音表示是可行的,即无需依赖手工设计的特征。代码与模型可在 https://github.com/ahaliassos/raven 获取。
引用
@article{arxiv.2212.06246,
title = {Jointly Learning Visual and Auditory Speech Representations from Raw Data},
author = {Alexandros Haliassos and Pingchuan Ma and Rodrigo Mira and Stavros Petridis and Maja Pantic},
journal= {arXiv preprint arXiv:2212.06246},
year = {2023}
}
备注
ICLR 2023. Code: https://github.com/ahaliassos/raven