学习跨语言视觉语音表征
计算与语言
2023-03-17 v1 计算机视觉与模式识别
机器学习
声音
音频与语音处理
摘要
跨语言自监督学习在过去几年中已成为一个日益增长的研究课题。然而,现有工作仅探索了利用音频信号来创建表征。在本工作中,我们研究跨语言自监督视觉表征学习。我们使用近期提出的原始音视觉语音编码器(RAVEn)框架,以无标注多语言数据预训练一个音视觉模型,然后在有标注转写文本上微调视觉模型。我们的实验表明:(1) 数据更多的多语言模型优于单语言模型,但在数据量固定时,单语言模型往往达到更好性能;(2) 多语言预训练优于仅英语预训练;(3) 使用更相似的语言带来更好结果;(4) 在未见语言上微调可与在预训练集中使用目标语言相竞争。我们希望本研究能启发未来关于非仅英语语音表征学习的研究。
引用
@article{arxiv.2303.09455,
title = {Learning Cross-lingual Visual Speech Representations},
author = {Andreas Zinonos and Alexandros Haliassos and Pingchuan Ma and Stavros Petridis and Maja Pantic},
journal= {arXiv preprint arXiv:2303.09455},
year = {2023}
}