中文

语音神经模型中的离散表示

计算与语言 2021-09-17 v2 机器学习 声音 音频与语音处理

摘要

神经网络所使用的分布式连续表示与语言学中通常所用的符号表示相悖。向量量化已被提出作为一种诱导离散神经表示的方法,其在性质上更接近于语言学的对应表示。然而,尚不清楚哪些度量最适合分析此类离散表示。我们在弱监督语音模型背景下比较了四种常用度量的优劣。我们将它们应用于两种不同模型时所显示的结果进行比较,同时系统地研究离散化层的位置与大小的影响。我们发现不同的评估机制可能给出不一致的结果。虽然在大多数情况下可将其归因于不同度量的性质,但有一点仍令人担忧:以音素三元组最小对作为刺激材料会对较大的离散单元库存不利,这与应用于完整话语的度量不同。此外,尽管一般而言向量量化所诱导的表示与语言学中所假设的单元相关,但这种相关强度仅为中等。

关键词

引用

@article{arxiv.2105.05582,
  title  = {Discrete representations in neural models of spoken language},
  author = {Bertrand Higy and Lieke Gelderloos and Afra Alishahi and Grzegorz Chrupała},
  journal= {arXiv preprint arXiv:2105.05582},
  year   = {2021}
}

备注

Accepted for publication at BlackboxNLP 2021