中文

BRAVEn:改进视觉与听觉语音识别的自监督预训练

计算机视觉与模式识别 2024-04-03 v1

摘要

自监督学习近期在从无标签数据中学习视觉与听觉语音表征方面展现出巨大潜力。在本工作中,我们提出了 BRAVEn,作为近期 RAVEn 方法的扩展,该方法完全从原始视听数据中学习语音表征。我们对 RAVEn 的修改使得 BRAVEn 在多种设置下的自监督方法中取得了 SOTA 结果。此外,我们观察到,通过将无标签数据量大幅增加至远超其他自监督工作的规模,模型表现出良好的缩放特性。特别地,在 LRS3 测试集上,仅使用 30 小时的有标签数据且不使用外部 ASR 模型的情况下,我们在 VSR / ASR 任务中实现了 20.0% / 1.7% 的词错误率。我们的结果表明,易于获取的无标签视听数据可以在很大程度上替代昂贵的转录数据。

关键词

引用

@article{arxiv.2404.02098,
  title  = {BRAVEn: Improving Self-Supervised Pre-training for Visual and Auditory Speech Recognition},
  author = {Alexandros Haliassos and Andreas Zinonos and Rodrigo Mira and Stavros Petridis and Maja Pantic},
  journal= {arXiv preprint arXiv:2404.02098},
  year   = {2024}
}

备注

ICASSP 2024. Code: https://github.com/ahaliassos/raven