中文

基于持续预训练与可学习池化的无转录目标语言声学词嵌入

计算与语言 2023-06-06 v1 机器学习 声音 音频与语音处理

摘要

声学词嵌入通常通过训练池化函数并利用类词单元对来创建。对于无监督系统,这些单元通过使用 k 近邻(KNN)搜索挖掘,该方法速度较慢。最近,来自预训练自监督英语模型的均值池化表示被提议作为一种有前景的替代方案,但其在目标语言上的性能未完全具有竞争力。在此,我们探索对两种方法的改进:我们使用持续预训练将自监督模型适配到目标语言,并使用多语言音素识别器(MPR)挖掘音素 n-gram 对以训练池化函数。在四种语言上评估,我们表明两种方法均在词判别上优于近期方法。此外,MPR 方法比 KNN 快数个数量级,且数据效率极高。我们还展示了在持续预训练表示之上执行可学习池化带来的微小提升。

关键词

引用

@article{arxiv.2306.02153,
  title  = {Acoustic Word Embeddings for Untranscribed Target Languages with Continued Pretraining and Learned Pooling},
  author = {Ramon Sanabria and Ondrej Klejch and Hao Tang and Sharon Goldwater},
  journal= {arXiv preprint arXiv:2306.02153},
  year   = {2023}
}

备注

Accepted to Interspeech 2023