中文

学习跨语言视觉语音表征

计算与语言 2023-03-17 v1 计算机视觉与模式识别 机器学习 声音 音频与语音处理

摘要

跨语言自监督学习在过去几年中已成为一个日益增长的研究课题。然而,现有工作仅探索了利用音频信号来创建表征。在本工作中,我们研究跨语言自监督视觉表征学习。我们使用近期提出的原始音视觉语音编码器(RAVEn)框架,以无标注多语言数据预训练一个音视觉模型,然后在有标注转写文本上微调视觉模型。我们的实验表明:(1) 数据更多的多语言模型优于单语言模型,但在数据量固定时,单语言模型往往达到更好性能;(2) 多语言预训练优于仅英语预训练;(3) 使用更相似的语言带来更好结果;(4) 在未见语言上微调可与在预训练集中使用目标语言相竞争。我们希望本研究能启发未来关于非仅英语语音表征学习的研究。

关键词

引用

@article{arxiv.2303.09455,
  title  = {Learning Cross-lingual Visual Speech Representations},
  author = {Andreas Zinonos and Alexandros Haliassos and Pingchuan Ma and Stavros Petridis and Maja Pantic},
  journal= {arXiv preprint arXiv:2303.09455},
  year   = {2023}
}