用于半监督语音识别的对比孪生网络
机器学习
2022-05-30 v1
摘要
本文提出对比孪生(c-siam)网络,一种在语音识别中利用无标签声学数据的架构。c-siam 是首个通过匹配两个相同 transformer 编码器的输出来从语音中提取高层语言信息的网络。它包含增强分支和目标分支,训练方式为:(1) 掩码输入并用对比损失匹配输出,(2) 在目标分支上引入停止梯度操作,(3) 在增强分支上使用额外的可学习变换,(4) 引入新的时间增强函数以防止捷径学习问题。我们使用 Libri-light 60k 无监督数据和 LibriSpeech 100hrs/960hrs 有监督数据来比较 c-siam 与其他性能最优系统。我们的实验表明,c-siam 相较 wav2vec 基线提供 20% 的相对词错误率提升。具有 450M 参数的 c-siam 网络取得了与具有 600M 参数的最先进网络相竞争的结果。
引用
@article{arxiv.2205.14054,
title = {Contrastive Siamese Network for Semi-supervised Speech Recognition},
author = {Soheil Khorram and Jaeyoung Kim and Anshuman Tripathi and Han Lu and Qian Zhang and Hasim Sak},
journal= {arXiv preprint arXiv:2205.14054},
year = {2022}
}