中文

声学词嵌入是否捕捉音系相似性?一项实证研究

计算与语言 2021-06-17 v1 声音 音频与语音处理

摘要

多种深度神经网络变体已成功用于构建参数化模型,将变时长口语词段投影到定长向量表示,即声学词嵌入(AWEs)。然而,我们在多大程度上可以依赖新兴 AWE 空间中的距离作为词形相似度的估计仍不清楚。在本文中,我们提问:声学嵌入空间中的距离是否与音系不相似度相关?为回答该问题,我们实证研究了具有不同神经架构和学习目标的 AWE 监督方法的性能。我们在受控设置下为两种语言(德语和捷克语)训练 AWE 模型,并在两项任务上评估嵌入:词判别与音系相似性。我们的实验表明:(1)在最佳情况下,嵌入空间中的距离仅与音系距离中等程度相关;(2)提升词判别任务上的性能未必能产生更好反映词音系相似性的模型。我们的发现凸显了重新思考当前 AWE 内在评估的必要性。

关键词

引用

@article{arxiv.2106.08686,
  title  = {Do Acoustic Word Embeddings Capture Phonological Similarity? An Empirical Study},
  author = {Badr M. Abdullah and Marius Mosbach and Iuliia Zaitova and Bernd Möbius and Dietrich Klakow},
  journal= {arXiv preprint arXiv:2106.08686},
  year   = {2021}
}

备注

Accepted in Interspeech 2021