视觉 grounded 语音模型中的词识别、竞争与激活
计算与语言
2019-09-19 v1 机器学习
摘要
本文研究在视觉 grounded 语音的循环神经模型中,类词单元如何被表示与激活。我们实验中所用的模型被训练为将图像及其口语描述投影到一个共同的表示空间中。我们表明,在口语句子上训练的循环模型会隐式地将输入分割为类词单元,并可靠地将它们映射到正确的视觉指称对象。我们引入一种源自语言学的方法来分析了神经网络所学到的表示——门控范式(gating paradigm)——并表明只有当网络能够访问目标词的首个音素时,该词的正确表示才会被激活,这意味着网络并不依赖于全局声学模式。此外,我们发现并非所有语音帧(在我们的例子中为 MFCC 向量)在给定的词的最终编码表示中都起到同等作用,而是某些帧对其具有关键影响。最后,我们提出词的表示可能通过词汇竞争的过程被激活。
引用
@article{arxiv.1909.08491,
title = {Word Recognition, Competition, and Activation in a Model of Visually Grounded Speech},
author = {William N. Havard and Jean-Pierre Chevrot and Laurent Besacier},
journal= {arXiv preprint arXiv:1909.08491},
year = {2019}
}
备注
Accepted at CoNLL2019