中文

具身语音循环神经模型中的音系编码

计算与语言 2018-10-30 v2 机器学习 声音

摘要

我们研究了具身语音的循环神经网络模型中音素的表示与编码。我们使用一个处理图像及其口语描述,并将视觉与听觉表示投影到同一语义空间的模型。我们针对从语音信号提取的MFCC特征以及模型各层激活中个体音素信息如何被编码进行了若干分析。通过音素解码和音素辨别实验,我们表明音素表示在模型的较低层最为显著,其中低级信号在细粒度水平上被处理,尽管大量音系信息保留在顶部循环层。我们进一步发现,顶部循环层之后的注意力机制显著衰减了音系的编码,并使话语嵌入对同义性更加不变。此外,网络学习的音素表示的分层聚类显示出与语言学中所提出的相似音素组织结构。

关键词

引用

@article{arxiv.1706.03815,
  title  = {Encoding of phonology in a recurrent neural model of grounded speech},
  author = {Afra Alishahi and Marie Barking and Grzegorz Chrupała},
  journal= {arXiv preprint arXiv:1706.03815},
  year   = {2018}
}

备注

Accepted at CoNLL 2017