CSTNet:用于自监督语音表征学习的对比语音翻译网络
音频与语音处理
2020-08-06 v2 计算与语言
机器学习
声音
摘要
世界上 7000 种语言中有一半以上面临迫近的灭绝危险。传统的语言记录方法先收集音频数据,再由训练有素的语言学家进行不同粒度的手动标注。这一耗时且艰苦的过程可受益于机器学习。许多濒危语言没有任何正字法形式,但通常有双语使用者且受过资源丰富语言的训练。获取与语音相对应的文本翻译相对容易。在这项工作中,我们通过利用语音及其对应文本翻译这两种模态之间的相关性,提供了一个用于语音表征学习的多模态机器学习框架。此处,我们构建了一个卷积神经网络音频编码器,能够从语音中提取语言表征。该音频编码器在对比学习框架中被训练以执行语音-翻译检索任务。通过在音素识别任务上评估所学表征,我们证明了语言表征作为学习执行检索任务的副产品出现在音频编码器的内部表征中。
引用
@article{arxiv.2006.02814,
title = {CSTNet: Contrastive Speech Translation Network for Self-Supervised Speech Representation Learning},
author = {Sameer Khurana and Antoine Laurent and James Glass},
journal= {arXiv preprint arXiv:2006.02814},
year = {2020}
}